GPT-5.6: Sol, Terra или Luna

У семейства GPT-5.6 нет одной конфигурации, которая всегда лучше остальных. Sol даёт максимальную надёжность, Luna — лучший результат за свои деньги, а Terra занимает промежуточную позицию. Но на практике выбор зависит не только от модели: уровень reasoning effort меняет картину не меньше, чем название модели.

Что показал DeepSWE

Ниже — результаты DeepSWE v1.1 для трёх моделей и пяти уровней effort. pass@1 показывает долю задач, решённых с первой попытки: чем выше, тем лучше. Avg cost — средняя стоимость одного запуска в этом тесте, а не цена миллиона API-токенов.

DeepSWE v1.1 · pass@1, выше — лучше
DeepSWE v1.1 · pass@1, выше — лучше
КонфигурацияPass@1
Sol max73%
Sol xhigh71%
Terra max70%
Sol high69%
Luna max67%
Sol medium61%
Terra xhigh60%
Luna xhigh57%
Terra high54%
Sol low45%
Luna high44%
Terra medium35%
Terra low24%
Luna medium11%
Luna low2%
Модель и effortPass@1Средняя стоимостьВыходные токеныШаги
Sol max73% ±3%$8.3960k61
Sol xhigh71% ±1%$4.7041k44
Terra max70% ±3%$4.9572k76
Sol high69% ±1%$3.4728k37
Luna max67% ±4%$3.0373k102
Sol medium61% ±2%$1.8618k31
Terra xhigh60% ±2%$2.1340k43
Luna xhigh57% ±2%$1.5445k71
Terra high54% ±4%$1.1322k34
Sol low45% ±2%$1.0711k23
Luna high44% ±3%$0.7826k49
Terra medium35% ±3%$0.5812k25
Terra low24% ±1%$0.438.6k21
Luna medium11% ±1%$0.228.2k24
Luna low2% ±1%$0.073.1k12

Максимальный результат показывает Sol max — 73%, но он же обходится дороже всего: $8.39 за запуск. Sol xhigh отстаёт всего на два процентных пункта, зато стоит на 44% дешевле. С учётом погрешности этот небольшой разрыв нельзя воспринимать как гарантированное преимущество в каждой реальной задаче.

Ещё показательнее сравнение Sol high и Sol max: 69% против 73%, но $3.47 против $8.39. Последние четыре пункта pass@1 увеличивают среднюю стоимость примерно в 2,4 раза.

Средняя стоимость запуска, ниже — дешевле
Средняя стоимость запуска, ниже — дешевле
КонфигурацияСтоимость
Sol max$8.39
Terra max$4.95
Sol xhigh$4.70
Sol high$3.47
Luna max$3.03
Terra xhigh$2.13
Sol medium$1.86
Luna xhigh$1.54
Terra high$1.13
Sol low$1.07
Luna high$0.78
Terra medium$0.58
Terra low$0.43
Luna medium$0.22
Luna low$0.07

Лучшее соотношение цены и результата — Luna

Luna хорошо показывает главный эффект семейства 5.6: дешёвая базовая модель может компенсировать ограничения более долгим рассуждением. На max она делает 102 шага — больше любой другой конфигурации — и тратит 73 тысячи выходных токенов, но всё равно стоит дешевле Sol high.

Цена этой экономии — время и предсказуемость. Luna идёт к результату длиннее, а погрешность Luna max составляет ±4%. Для автономной работы, где важнее цена итогового решения, чем скорость одного прогона, это разумный обмен.

Когда выбирать Luna

Для критичного кода — Sol

Sol medium показывает 61% за $1.86, а Sol high69% за $3.47. Оба режима требуют заметно меньше шагов, чем Luna на сопоставимом уровне результата. Для сложного production-кода это означает более прямой путь к решению и меньше пространства для накопления ошибок в длинной цепочке действий.

Sol max имеет смысл только там, где даже небольшой прирост качества оправдывает более чем двукратную переплату относительно high. Для обычной разработки это редкий случай.

Когда выбирать Sol

Бюджетная рабочая база — Sol low

Sol low даёт 45% pass@1 при средней стоимости $1.07. Это не рекорд по абсолютной экономии, но хороший baseline для небольших, чётко сформулированных задач.

В этом режиме Sol почти совпадает с Luna high по результату — 45% против 44%. Luna дешевле на $0.29, но делает 49 шагов вместо 23. Если важны не только деньги, но и скорость с более короткой траекторией решения, Sol low выглядит практичнее.

Где находится Terra

Terra логично выглядит как середина семейства, но в этом benchmark у неё нет очевидной точки победы. Terra max достигает 70% за $4.95 — результат сильный, однако Sol xhigh одновременно немного точнее и дешевле. Terra high даёт 54% за $1.13, тогда как Luna xhigh стоит на $0.41 дороже, но прибавляет три пункта pass@1.

Это не делает Terra плохой моделью. Один benchmark не описывает все типы работы, а погрешности частично перекрываются. Но по данным именно этого теста Terra чаще оказывается компромиссом, а не лучшим выбором.

Как выбирать конфигурацию

СценарийРекомендацияПочему
Максимум качества любой ценойSol maxЛучший pass@1 — 73%
Критичный production-кодSol medium / highВысокая надёжность без резкого скачка цены max
Лучшее соотношение цены и качестваLuna xhigh / maxСильный результат при заметно меньшей стоимости
Узкие бюджетные задачиSol lowКороткая траектория и предсказуемый baseline
Массовые некритичные прогоныLuna highПочти результат Sol low, но дешевле

Не выбирайте модель только по верхней строке рейтинга. Сначала определите цену ошибки, допустимое время выполнения и возможность проверить результат. После этого выбирайте не просто модель, а связку модель + effort.

Итог