GPT-5.6 Sol, GPT-5.6 Luna, Claude Fable 5

На изображении сравнивают три модели: GPT-5.6 Sol, GPT-5.6 Luna и Claude Fable 5. Ниже — те же данные в таблицах.

Основные тесты

В этой таблице большее значение означает лучший результат. Зелёным отмечен лучший результат в строке, красным — худший. Среднее значение оставлено без цвета. Сравнивать строки между собой не стоит: тесты измеряют разные навыки.

ТестGPT-5.6 SolGPT-5.6 LunaClaude Fable 5
AA Intelligence Index58,951,259,9
Agents’ Last Exam52,750,340,5
Management consulting43,235,435,5
AA Coding Agent Index80,074,677,2
SWE-Bench Pro64,662,780,0
DeepSWE v1.172,767,269,7
Terminal-Bench 2.188,884,783,1
GPQA Diamond94,692,392,6
FrontierMath Tier 483,058,587,8
Toolathlon58,053,461,7
GraphWalks 1M77,151,268,1

Sol показывает лучший результат в семи строках из одиннадцати. Fable 5 лидирует в четырёх: AA Intelligence Index, SWE-Bench Pro, FrontierMath Tier 4 и Toolathlon. Luna ни в одной строке не выходит на первое место.

Тесты с другой шкалой

Эти результаты вынесены отдельно: у них другая шкала, поэтому их нельзя напрямую сопоставлять с таблицей выше.

ТестGPT-5.6 SolGPT-5.6 LunaClaude Fable 5
GDPval-AA v2 (Elo)1 747,81 591,81 759,6
ARC-AGI-3 verified7,78%0,18%Не опубликовано

В GDPval-AA v2 разница между Fable 5 и Sol небольшая: 11,8 балла Elo. В ARC-AGI-3 у Fable 5 нет опубликованного результата, а показатель Sol заметно выше Luna.

Стоимость API

Цены указаны в долларах за миллион токенов. В последнем столбце посчитана стоимость одного миллиона входных и 500 тысяч выходных токенов. Здесь меньшее значение выгоднее.

МодельВход / 1 млнВыход / 1 млн1 млн вход + 0,5 млн выход
GPT-5.6 Sol$5$30$20
GPT-5.6 Luna$1$6$4
Claude Fable 5$10$50$35

Luna стоит в пять раз дешевле Sol и в десять раз дешевле Fable 5 по входным токенам. В примере смешанного запроса она в пять раз дешевле Sol и почти в девять раз дешевле Fable 5.

Коротко