Skip to content

Latest commit

 

History

36 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Битрикс AI Челлендж: Сравнение моделей в разработке на 1С-Битрикс

Бенчмарк AI-агентов на реальной задаче 1С-Битрикс. Тест на то, ведёт ли себя агент как битрикс-разработчик: развернёт ли данные воспроизводимо, сделает ли модуль и админку штатными средствами платформы, удержит ли уровень выбранного дизайн-референса, починит ли решение по замечаниям заказчика без подсказок.

Челлендж проводит сообщество BXMax — платформа для разработчиков 1С-Битрикс: практические материалы, разборы ядра, эксперименты с AI и обмен опытом между коллегами.

BXMax: bxmax.ru · Telegram · Bitrix AI Challenge

Результаты и разборы каждого прогона — на сайте: bxmax.ru/bitrix-ai/challenge. Здесь, в репозитории, — задание, рубрика и исходники сабмишенов.

Единица сравнения — связка: приложение + модель + скиллы. Один и тот же агентский стек (bitrix-framework-skills) разворачивается на стенде для всех участников; насколько хорошо приложение умеет им распоряжаться — часть измеряемого результата.

Задача

Одна сквозная задача, как реальный заказ веб-студии — task/TASK.md: лендинг студии маникюра «Лак&Точка» с онлайн-записью, под ключ на чистом Битриксе. Агент сам выбирает дизайн-референс на awwwards и воспроизводит его визуально своей вёрсткой, сам проектирует и наполняет инфоблоки услуг и мастеров, сам пишет тексты — и делает модуль записи: расписание слотов, форма с согласием на обработку ПДн, защита от двойного бронирования, уведомление администратору, админка заявок и слотов штатными средствами.

Один прогон, оценивается по двум срезам:

Срез Что проверяет Оценка
Визуал дизайн + вёрстка: референс, композиция, адаптив, доступность, тексты 0–100
Бэкенд модуль на D7: архитектура, ORM, идиоматичность, ошибки, безопасность, админка 0–100

Результаты

Топ-10 связок на главной, разбивка по тирам Balanced: A ≥ 85 · B 70–84 · C 50–69 · D < 50. Внутри тира различия не интерпретируются (один прогон на связку); при равном тире выше та, у которой меньше итераций. Полная таблица — results/leaderboard.md.

Тир B

Связка Визуал Бэкенд Balanced Итерации Время Расход Вердикт Разбор на сайте
Claude Code · Claude Opus 5 High 79.5 85.0 82.2 1 90 мин 14% 5ч · Max 5x ($100) verdict bxmax.ru
Cursor · Grok 4.6 High 65.5 78.5 71.7 1 45 мин 2% мес. · Pro ($20) verdict bxmax.ru

Тир C

Связка Визуал Бэкенд Balanced Итерации Время Расход Вердикт Разбор на сайте
Codex · GPT 5.6 Sol High 71.5 65.5 68.4 1 63 мин 64% 5ч · Plus ($20) verdict bxmax.ru

Каждая строка — один прогон. Всё по прогону лежит в submissions/<app>/<model>/: run.yaml (метаданные), feedback.md (замечания между итерациями дословно), code/ (код агента и SOLUTION.md), screenshots/ (обложка, полный скриншот страницы, галерея), review-model.md, review-author.md, verdict.md (баллы по критериям, комментарии, вывод).

Те же прогоны с баллами по критериям, выводом и скриншотами — на bxmax.ru: Bitrix AI Challenge; страница прогона bxmax.ru/bitrix-ai/challenge/<app>-<model> собирается из этой папки.

Как устроена оценка

Автопроверок нет — оценивают автор и модель по одной рубрике (harness/rubric.yaml):

  • Модель-ревьювер — на том же стенде, что и агент: код, ядро, скиллы, живой сайт через встроенный браузер; не знает, чья связка перед ней; каждая претензия ссылается на файл:строку или место на странице.
  • Автор челленджа — по живому стенду: пройти запись как клиент, открыть админку как администратор, открыть код как битрикс-разработчик. Ставит баллы, не читая ревью модели.
  • Итог — среднее двух оценок по каждому критерию, два среза 0–100, Balanced и тир. Вердикт: комментарий автора, отобранные им замечания ревьювера и короткий читаемый вывод по связке.

Агент получает столько итераций, сколько нужно до рабочего результата, но не больше десяти: первая полностью автономна, дальше автор пишет замечания в тот же чат — как заказчик, без подсказок по решению (правила в harness/FEEDBACK.md). Число итераций, время и токены — отдельные колонки лидерборда; лучшее — с первого прогона.

Все прогоны идут на одинаковых свежих стендах, развёрнутых в Omut — нашем локальном окружении для 1С-Битрикс (nginx, PHP, MySQL, Redis без Docker).

Методология целиком: CHALLENGE.md — стенд, протокол прогона, рубрика, тиры и раздел об ограничениях.

Архив v1

Первая волна челленджа (ТЗ «Избранное», 10 моделей) — в archive/v1/. Методология другая, баллы с v2 не сравнимы.

Связанные проекты

  • bxmaximum/bitrix-framework-skills — AI-скиллы по D7, тот самый стек, который получает каждый участник челленджа.
  • Omut — локальное окружении для 1С-Битрикс (Windows, macOS, Linux)

About

BXMax — первая специализированная платформа для разработчиков 1С-Битрикс. Мы делаем современную разработку на D7 понятнее: от разборов ядра до практики с AI-агентами.

Челлендж — часть нашей открытой экосистемы: скиллы собираем на реальных задачах, проверяем здесь на бенчмарке и публикуем разборы в Bitrix AI Challenge.

Что есть на BXMax

Раздел Что внутри
Блог Разборы API, туториалы, мнения о ядре
Кофе && Код Короткие практические советы по D7
Bitrix × AI Сравнение AI-моделей на реальных ТЗ
Omut Локальное окружение для 1С-Битрикс и Битрикс24 — на нём работают стенды челленджа
Telegram Анонсы материалов, скиллов и обновлений

Ссылки: bxmax.ru · Telegram · Bitrix AI Challenge · GitHub

About

AI челлендж для моделей в программировании под 1С-Битрикс

Topics

Resources

Stars

36 stars

Watchers

3 watching

Forks

Releases

Packages

Contributors

Languages