Выбрать серию испытаний
Системные промпты Sol и Luna
Одни задания, разные конфигурации
Нажмите на результат, чтобы сравнить варианты.Все проверки пройденыЧасть попыток прошлаНе прошло— нет выполненного прогона
Показатели выбранных прогонов
ИСХОДНЫЙ ЗАПРОС
Исходные файлы задания
Сценарии и критерии оценки
Каждая сохранённая попытка
Что означают метрики и какие данные включены
- Для кодовых заданий показано выполнение скрытых условий. Дробь в матрице — сколько попыток прошло из числа оценённых. Набор выполненных заданий у моделей различается, поэтому сводка показывает охват.
- Вопрос про кружку проверяется отдельно: ответ должен предложить перевернуть её и не отрицать работоспособность решения. Это текстовая автоматическая проверка; полный ответ доступен для просмотра.
- Для игр отдельно показаны загрузка, отрисовка, ошибки и реакция на ввод. Эти проверки и FPS headless-браузера не оценивают качество игры. Скриншоты сохранены при одинаковом сценарии.
- Игры в текущем наборе оцениваются как one-shot. Ручные исправления запуска открываются отдельно с пометкой «Исправлено для просмотра»; их оценки относятся к отдельной серии PANEL.
- Для web-приложений отдельно проверяются действия пользователя на экранах 1440 × 900 и 390 × 844: навигация, изменение данных, ошибки, отмена, сохранение после перезагрузки. Работоспособность не является оценкой дизайна.
- В слепом тестировании PANEL участники видят A и B с одинаковым заданием; порядок меняется случайно, названия моделей и промптов скрыты. Можно сравнивать разные промпты одного Sol. Удобство, игровой опыт и визуальный дизайн оцениваются разными вопросами. Голоса, равенства и пропуски показаны отдельно от автоматических проверок. Число голосов не равно числу независимых участников.
- Счётчики слов, склеек, латиницы и шаблонных фраз — механические признаки. Они не заменяют оценку письменности человеком.
- Стоимость взята из OpenCode и является оценкой основной сессии, без полной сверки биллинга. Время включает исполнение испытания и проверки.
- Технические ошибки стенда показаны отдельно и не входят в долю выполненных заданий. Effort, системный промпт и сборка OpenCode сохранены как отдельные конфигурации. Для Sol сравниваются наш стандартный, штатный gpt.txt и экспериментальные варианты; точные тексты и фактический системный контекст сохранены.