GPT-5.6: Sol, Terra или Luna
У семейства GPT-5.6 нет одной конфигурации, которая всегда лучше остальных. Sol даёт максимальную надёжность, Luna — лучший результат за свои деньги, а Terra занимает промежуточную позицию. Но на практике выбор зависит не только от модели: уровень reasoning effort меняет картину не меньше, чем название модели.
Что показал DeepSWE
Ниже — результаты DeepSWE v1.1 для трёх моделей и пяти уровней effort. pass@1 показывает долю задач, решённых с первой попытки: чем выше, тем лучше. Avg cost — средняя стоимость одного запуска в этом тесте, а не цена миллиона API-токенов.
| Конфигурация | Pass@1 |
|---|---|
| Sol max | 73% |
| Sol xhigh | 71% |
| Terra max | 70% |
| Sol high | 69% |
| Luna max | 67% |
| Sol medium | 61% |
| Terra xhigh | 60% |
| Luna xhigh | 57% |
| Terra high | 54% |
| Sol low | 45% |
| Luna high | 44% |
| Terra medium | 35% |
| Terra low | 24% |
| Luna medium | 11% |
| Luna low | 2% |
| Модель и effort | Pass@1 | Средняя стоимость | Выходные токены | Шаги |
|---|---|---|---|---|
Sol max | 73% ±3% | $8.39 | 60k | 61 |
Sol xhigh | 71% ±1% | $4.70 | 41k | 44 |
Terra max | 70% ±3% | $4.95 | 72k | 76 |
Sol high | 69% ±1% | $3.47 | 28k | 37 |
Luna max | 67% ±4% | $3.03 | 73k | 102 |
Sol medium | 61% ±2% | $1.86 | 18k | 31 |
Terra xhigh | 60% ±2% | $2.13 | 40k | 43 |
Luna xhigh | 57% ±2% | $1.54 | 45k | 71 |
Terra high | 54% ±4% | $1.13 | 22k | 34 |
Sol low | 45% ±2% | $1.07 | 11k | 23 |
Luna high | 44% ±3% | $0.78 | 26k | 49 |
Terra medium | 35% ±3% | $0.58 | 12k | 25 |
Terra low | 24% ±1% | $0.43 | 8.6k | 21 |
Luna medium | 11% ±1% | $0.22 | 8.2k | 24 |
Luna low | 2% ±1% | $0.07 | 3.1k | 12 |
Максимальный результат показывает Sol max — 73%, но он же обходится дороже всего: $8.39 за запуск. Sol xhigh отстаёт всего на два процентных пункта, зато стоит на 44% дешевле. С учётом погрешности этот небольшой разрыв нельзя воспринимать как гарантированное преимущество в каждой реальной задаче.
Ещё показательнее сравнение Sol high и Sol max: 69% против 73%, но $3.47 против $8.39. Последние четыре пункта pass@1 увеличивают среднюю стоимость примерно в 2,4 раза.
| Конфигурация | Стоимость |
|---|---|
| Sol max | $8.39 |
| Terra max | $4.95 |
| Sol xhigh | $4.70 |
| Sol high | $3.47 |
| Luna max | $3.03 |
| Terra xhigh | $2.13 |
| Sol medium | $1.86 |
| Luna xhigh | $1.54 |
| Terra high | $1.13 |
| Sol low | $1.07 |
| Luna high | $0.78 |
| Terra medium | $0.58 |
| Terra low | $0.43 |
| Luna medium | $0.22 |
| Luna low | $0.07 |
Лучшее соотношение цены и результата — Luna
Luna хорошо показывает главный эффект семейства 5.6: дешёвая базовая модель может компенсировать ограничения более долгим рассуждением. На max она делает 102 шага — больше любой другой конфигурации — и тратит 73 тысячи выходных токенов, но всё равно стоит дешевле Sol high.
Цена этой экономии — время и предсказуемость. Luna идёт к результату длиннее, а погрешность Luna max составляет ±4%. Для автономной работы, где важнее цена итогового решения, чем скорость одного прогона, это разумный обмен.
Когда выбирать Luna
- задача допускает несколько итераций;
- можно подождать более длинное рассуждение;
- важна стоимость серии запусков;
- результат будет проверен тестами или человеком.
Для критичного кода — Sol
Sol medium показывает 61% за $1.86, а Sol high — 69% за $3.47. Оба режима требуют заметно меньше шагов, чем Luna на сопоставимом уровне результата. Для сложного production-кода это означает более прямой путь к решению и меньше пространства для накопления ошибок в длинной цепочке действий.
Sol max имеет смысл только там, где даже небольшой прирост качества оправдывает более чем двукратную переплату относительно high. Для обычной разработки это редкий случай.
Когда выбирать Sol
- большой рефакторинг с широким радиусом изменений;
- код, связанный с деньгами, данными или безопасностью;
- сложная отладка, где неверная гипотеза дорого обходится;
- задача должна быть закрыта уверенно за один проход.
Бюджетная рабочая база — Sol low
Sol low даёт 45% pass@1 при средней стоимости $1.07. Это не рекорд по абсолютной экономии, но хороший baseline для небольших, чётко сформулированных задач.
В этом режиме Sol почти совпадает с Luna high по результату — 45% против 44%. Luna дешевле на $0.29, но делает 49 шагов вместо 23. Если важны не только деньги, но и скорость с более короткой траекторией решения, Sol low выглядит практичнее.
Где находится Terra
Terra логично выглядит как середина семейства, но в этом benchmark у неё нет очевидной точки победы. Terra max достигает 70% за $4.95 — результат сильный, однако Sol xhigh одновременно немного точнее и дешевле. Terra high даёт 54% за $1.13, тогда как Luna xhigh стоит на $0.41 дороже, но прибавляет три пункта pass@1.
Это не делает Terra плохой моделью. Один benchmark не описывает все типы работы, а погрешности частично перекрываются. Но по данным именно этого теста Terra чаще оказывается компромиссом, а не лучшим выбором.
Как выбирать конфигурацию
| Сценарий | Рекомендация | Почему |
|---|---|---|
| Максимум качества любой ценой | Sol max | Лучший pass@1 — 73% |
| Критичный production-код | Sol medium / high | Высокая надёжность без резкого скачка цены max |
| Лучшее соотношение цены и качества | Luna xhigh / max | Сильный результат при заметно меньшей стоимости |
| Узкие бюджетные задачи | Sol low | Короткая траектория и предсказуемый baseline |
| Массовые некритичные прогоны | Luna high | Почти результат Sol low, но дешевле |
Не выбирайте модель только по верхней строке рейтинга. Сначала определите цену ошибки, допустимое время выполнения и возможность проверить результат. После этого выбирайте не просто модель, а связку модель + effort.