Бенчмарк AI-агентов на реальной задаче 1С-Битрикс. Тест на то, ведёт ли себя агент как битрикс-разработчик: развернёт ли данные воспроизводимо, сделает ли модуль и админку штатными средствами платформы, удержит ли уровень выбранного дизайн-референса, починит ли решение по замечаниям заказчика без подсказок.
Челлендж проводит сообщество BXMax — платформа для разработчиков 1С-Битрикс: практические материалы, разборы ядра, эксперименты с AI и обмен опытом между коллегами.
BXMax: bxmax.ru · Telegram · Bitrix AI Challenge
Результаты и разборы каждого прогона — на сайте: bxmax.ru/bitrix-ai/challenge. Здесь, в репозитории, — задание, рубрика и исходники сабмишенов.
Единица сравнения — связка: приложение + модель + скиллы. Один и тот же агентский стек (bitrix-framework-skills) разворачивается на стенде для всех участников; насколько хорошо приложение умеет им распоряжаться — часть измеряемого результата.
Одна сквозная задача, как реальный заказ веб-студии — task/TASK.md: лендинг студии маникюра «Лак&Точка» с онлайн-записью, под ключ на чистом Битриксе. Агент сам выбирает дизайн-референс на awwwards и воспроизводит его визуально своей вёрсткой, сам проектирует и наполняет инфоблоки услуг и мастеров, сам пишет тексты — и делает модуль записи: расписание слотов, форма с согласием на обработку ПДн, защита от двойного бронирования, уведомление администратору, админка заявок и слотов штатными средствами.
Один прогон, оценивается по двум срезам:
| Срез | Что проверяет | Оценка |
|---|---|---|
| Визуал | дизайн + вёрстка: референс, композиция, адаптив, доступность, тексты | 0–100 |
| Бэкенд | модуль на D7: архитектура, ORM, идиоматичность, ошибки, безопасность, админка | 0–100 |
Топ-10 связок на главной, разбивка по тирам Balanced: A ≥ 85 · B 70–84 · C 50–69 · D < 50. Внутри тира различия не интерпретируются (один прогон на связку); при равном тире выше та, у которой меньше итераций. Полная таблица — results/leaderboard.md.
| Связка | Визуал | Бэкенд | Balanced | Итерации | Время | Расход | Вердикт | Разбор на сайте |
|---|---|---|---|---|---|---|---|---|
| Claude Code · Claude Opus 5 High | 79.5 | 85.0 | 82.2 | 1 | 90 мин | 14% 5ч · Max 5x ($100) | verdict | bxmax.ru |
| Cursor · Grok 4.6 High | 65.5 | 78.5 | 71.7 | 1 | 45 мин | 2% мес. · Pro ($20) | verdict | bxmax.ru |
| Связка | Визуал | Бэкенд | Balanced | Итерации | Время | Расход | Вердикт | Разбор на сайте |
|---|---|---|---|---|---|---|---|---|
| Codex · GPT 5.6 Sol High | 71.5 | 65.5 | 68.4 | 1 | 63 мин | 64% 5ч · Plus ($20) | verdict | bxmax.ru |
Каждая строка — один прогон. Всё по прогону лежит в submissions/<app>/<model>/: run.yaml (метаданные), feedback.md (замечания между итерациями дословно), code/ (код агента и SOLUTION.md), screenshots/ (обложка, полный скриншот страницы, галерея), review-model.md, review-author.md, verdict.md (баллы по критериям, комментарии, вывод).
Те же прогоны с баллами по критериям, выводом и скриншотами — на bxmax.ru: Bitrix AI Challenge; страница прогона bxmax.ru/bitrix-ai/challenge/<app>-<model> собирается из этой папки.
Автопроверок нет — оценивают автор и модель по одной рубрике (harness/rubric.yaml):
- Модель-ревьювер — на том же стенде, что и агент: код, ядро, скиллы, живой сайт через встроенный браузер; не знает, чья связка перед ней; каждая претензия ссылается на
файл:строкуили место на странице. - Автор челленджа — по живому стенду: пройти запись как клиент, открыть админку как администратор, открыть код как битрикс-разработчик. Ставит баллы, не читая ревью модели.
- Итог — среднее двух оценок по каждому критерию, два среза 0–100, Balanced и тир. Вердикт: комментарий автора, отобранные им замечания ревьювера и короткий читаемый вывод по связке.
Агент получает столько итераций, сколько нужно до рабочего результата, но не больше десяти: первая полностью автономна, дальше автор пишет замечания в тот же чат — как заказчик, без подсказок по решению (правила в harness/FEEDBACK.md). Число итераций, время и токены — отдельные колонки лидерборда; лучшее — с первого прогона.
Все прогоны идут на одинаковых свежих стендах, развёрнутых в Omut — нашем локальном окружении для 1С-Битрикс (nginx, PHP, MySQL, Redis без Docker).
Методология целиком: CHALLENGE.md — стенд, протокол прогона, рубрика, тиры и раздел об ограничениях.
Первая волна челленджа (ТЗ «Избранное», 10 моделей) — в archive/v1/. Методология другая, баллы с v2 не сравнимы.
- bxmaximum/bitrix-framework-skills — AI-скиллы по D7, тот самый стек, который получает каждый участник челленджа.
- Omut — локальное окружении для 1С-Битрикс (Windows, macOS, Linux)
BXMax — первая специализированная платформа для разработчиков 1С-Битрикс. Мы делаем современную разработку на D7 понятнее: от разборов ядра до практики с AI-агентами.
Челлендж — часть нашей открытой экосистемы: скиллы собираем на реальных задачах, проверяем здесь на бенчмарке и публикуем разборы в Bitrix AI Challenge.
| Раздел | Что внутри |
|---|---|
| Блог | Разборы API, туториалы, мнения о ядре |
| Кофе && Код | Короткие практические советы по D7 |
| Bitrix × AI | Сравнение AI-моделей на реальных ТЗ |
| Omut | Локальное окружение для 1С-Битрикс и Битрикс24 — на нём работают стенды челленджа |
| Telegram | Анонсы материалов, скиллов и обновлений |
Ссылки: bxmax.ru · Telegram · Bitrix AI Challenge · GitHub