# GPT-6/Sol: основания для экспериментальных промптов Сверка: 2026-10-05. Цель — выбрать проверяемые изменения системного промпта для `gpt-6.1-sol`. Публичные оценки не используются как рейтинг нашего бенчмарка. Sol, Astra и прежние GPT-5.x — разные модели; наблюдения о них не объединяются в одну статистику. ## Что нашлось | Наблюдение | Основание и ограничения | Изменение для проверки | | --- | --- | --- | | Выполнение может остановиться на вопросе, плане или частичном результате. | OpenAI описывает это для **GPT-6 Astra** в [официальном руководстве](https://developers.openai.com/api/docs/guides/latest-model.md). Рекомендации предлагаются всей семье, но эффект на Sol нужно измерить. | Сохраняем наш стандарт и отдельно проверяем `our-execution`. | | Повторяющиеся фразы, подробное форматирование и лишний текст. | То же руководство прямо описывает detailed/formatted responses и recurring phrases у Astra. Это не доказательство одинаковой частоты у Sol. | `our-writing`: конкретные факты, полнота без повторов и церемониальных фраз. | | Избыточные или повторные проверки могут затягивать небольшую задачу. | OpenAI рекомендует соразмерные тесты и завершение после необходимых проверок. | В `our-execution` проверяются контракты и реальные границы поведения; не задаётся число тестов или циклов. | | Операционный экран превращается в рекламную страницу, сетку карточек или пояснение функций. | [OpenAI Frontend prompt instructions](https://developers.openai.com/api/docs/guides/frontend-prompt.md), предназначенные для GPT-5.5, прямо рекомендуют рабочий экран первым, доменную композицию и отсутствие feature/style commentary в UI. | `our-product`, `our-interaction`: рабочая поверхность, компактный HUD, полезные состояния, минимум декоративного текста. | | Привычное действие показывается длинной текстовой плашкой вместо узнаваемого инструмента. | В frontend-руководстве OpenAI перечислены знакомые значки и подходящие типы контролов. [NN/g](https://www.nngroup.com/articles/icon-usability/) показывает обратную границу: неоднозначным иконкам нужны видимые подписи, hover не заменяет их на телефоне. | Иконки для стандартных действий, короткие подписи для неоднозначных, доступные имена и фокус. Это не запрет всего текста. | | Игра работает, но выглядит бедно и мало требует от игрока. | [BitsMinds, Sol 6.1 против Opus 5.5](https://www.bitsminds.com/news/claude-opus-5-5-vs-gpt-6-1-sol-hill-climb-2026): авторы описывают простую машину, журнальный UI и автоматически собираемые монеты. Приложены сами игры и измерения, но один прогон, разные harness, присутствовала память, оценки неслепые. | `our-game-art` и `our-interaction`: различимые формы/материалы и содержательная игровая петля. Не переносим их баллы к нам. | | Регрессия базовой игры может скрываться за успешными техническими тестами. | [Предыдущий раунд BitsMinds с GPT-6 Sol](https://www.bitsminds.com/news/claude-opus-5-5-vs-gpt-6-sol-vs-grok-4-7-hill-climb-2026): игру можно закончить удержанием одной клавиши; описаны проверки, которые этого не оценивали. Это прежний Sol, а не 6.1. | Проверять ход игры, управляемость и последствия действий, а не только запуск и смену пикселей. | | Sol может сделать минимально достаточный дизайн и пропустить подразумеваемую проработку. | [Thomas Wiegold, собственные три теста Sol 6.1](https://thomas-wiegold.com/blog/gpt-6-1-sol-review/) и [живые результаты](https://thomas-wiegold.com/blog/claude-sonnet-5-5-review/web-design-test/). Это единичные авторские оценки. На странице результатов у Sol всё же есть медленная анимация волны, поэтому буквальное «анимаций вообще нет» из обзора не принимаем. | Описывать качество через результат и согласованное взаимодействие; не требовать анимаций ради их количества. | | Красивая 3D-страница и хорошая игра — разные результаты. | [Promptslove, собственные сборки Sol 6.1](https://promptslove.com/blog/gpt-6-1-sol-review/): положительный пример часов, удачные отзывчивые контролы, но симулятор выглядит как web-страница, а motion-reel слабее Sonnet. Использовался Ultra с делегированием; конфигурация отличается от нашего max/OpenCode. | Художественный визуал, управление и игровой опыт оцениваются раздельно. Универсальное «Sol всегда хуже в 3D» не подтверждено. | | Шаблонный вид не обязательно означает недоступную модели способность. | [OpenAI, Designing delightful frontends](https://developers.openai.com/blog/designing-delightful-frontends-with-gpt-5-4) объясняет fallback к частым паттернам при расплывчатом запросе; [Anthropic frontend-design](https://github.com/anthropics/skills/blob/main/skills/frontend-design/SKILL.md) также описывает типовые визуальные defaults и screenshot-критику. Оба — рекомендации, не head-to-head Sol. | Явная доменная художественная идея, реальные материалы и просмотр рендера. Типографические ограничения из этих материалов не перенесены. | | Слишком длинные, повторяющиеся инструкции могут ухудшить результат. | [Официальная guidance для GPT-5.6 Sol](https://developers.openai.com/api/docs/guides/prompt-guidance-gpt-5p6.md) советует outcome-first и удаление повторов. Перенос на 6.1 — гипотеза. | Каждый эксперимент добавляет отдельную тему; `experiments` объединяет модули по одному разу и сравнивается с отдельными вариантами, а не объявляется лучшим заранее. | ## «Пластик»: что можно обосновать Пластиковые модели и текстуры — наблюдение пользователя о своих сборках. В прочитанных первоисточниках не найдено воспроизводимого исследования частоты именно такого дефекта у GPT-6.1 Sol. Причину конкретного рендера без его кода и кадров установить нельзя. Для направленной коррекции есть техническая основа: [Three.js MeshStandardMaterial](https://threejs.org/docs/pages/MeshStandardMaterial.html) различает roughness, metalness, normal/bump и цветовые данные; [Marmoset PBR](https://marmoset.co/posts/basic-theory-of-physically-based-rendering/) объясняет роль микроповерхности, отражения и света. Одинаково гладкие поверхности, отсутствующие или неверно масштабированные текстуры, слабые формы и неподходящее освещение — кандидаты причин, а не диагноз модели. Промпт просит разную материальность и осмотр кадров, сохраняя свободу стилю: pixel art и low-poly допустимы. ## Управление и проверка в движении [Microsoft XAG 107](https://learn.microsoft.com/en-us/gaming/accessibility/xbox-accessibility-guidelines/107) и [Game Accessibility Guidelines](https://gameaccessibilityguidelines.com/ensure-controls-are-as-simple-as-possible-or-provide-a-simpler-alternative/) обосновывают простые схемы ввода, доступность меню и альтернативные способы действия. [MDN Pointer Lock](https://developer.mozilla.org/en-US/docs/Web/API/Pointer_Lock_API) описывает пользовательский жест, выход/ошибки и ограничения iframe. Эти источники применимы к любой модели. [Кейс Playco/OpenAI](https://openai.com/index/playco-game-prototyping-with-astra) подчёркивает цикл engine → play → validate и отдельно упоминает необходимую оптимизацию одного прототипа. Это выбранный рекламный кейс Astra, не независимый процент успеха Sol. Полезен именно процесс: статичный скриншот не показывает дрожание, управление и игровой темп. В нашем стенде Chromium раньше был доступен лишь проверяющему. Для визуальных задач его нужно давать самому агенту одинаково во всех конфигурациях; просмотр результата и браузерная функциональность остаются отдельными от человеческого качества. ## Проверяемые варианты - `our-standard`: текущий `gpt-6.txt + project.md`. - `gpt`: точный штатный `gpt.txt` без нашего дополнения. - `our-execution`, `our-writing`, `our-product`: отдельные исходные эксперименты. - `our-game-art`: формы, материалы, свет, кадры, производительность. - `our-interaction`: иконки, UI, управление, игровой цикл и восстановление. - `experiments`: наш стандарт и все пять экспериментальных модулей без повторного включения `project.md`. Все варианты используют один model ID, один effort, одну сборку OpenCode, те же задания и ресурсы. Отдельные варианты нужны, чтобы видеть вклад модулей; совокупный промпт может оказаться хуже короткого. Результат определяется нашими функциональными проверками и слепыми голосами, а не количеством слов, полигонов или публичным рейтингом. Поисковые пересказы, Reddit/X без доступного полного контекста и жалобы на GPT-5.x не считались установленными дефектами 6.1. Скриншоты и игры из сторонних сравнений не добавлялись в задания или модельные результаты.