Навигация
AI BENCHY
Advertise here

Сравниваемые модели

Бенчмарк-сравнение GPT-5.5 (medium) vs GPT-5.4 (medium) vs Gemini 3.1 Pro Preview (medium) vs Claude Opus 4.7 (medium): Gemini 3.1 Pro Preview (medium) лидирует по Оценка со значением 9.2. GPT-5.5 (medium) лидирует по Надежность со значением 10.0. У Gemini 3.1 Pro Preview (medium) самый низкий Общая стоимость: $1.361. Claude Opus 4.7 (medium) самый быстрый: 7.61s.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-08-07

Ранг
#15
Общее число выходных токенов
124,436
Время ответа (среднее)
38.42s
Общая стоимость
$4.137
Ранг
#29
Общее число выходных токенов
88,670
Время ответа (среднее)
23.10s
Общая стоимость
$1.533
Ранг
#9
Общее число выходных токенов
97,958
Время ответа (среднее)
21.47s
Общая стоимость
$1.361
Ранг
#23
Общее число выходных токенов
29,990
Время ответа (среднее)
7.61s
Общая стоимость
$1.477
Рекомендуемая модель Gemini 3.1 Pro Preview (medium)

Здесь у него лучший балл (9.2), при этом он примерно в 1.8 раза дешевле, чем другие модели в этом сравнении.

Подробное сравнение

Метрика GPT-5.5 GPT-5.5 medium Релиз: 2026-04-24 GPT-5.4 GPT-5.4 medium Релиз: 2026-03-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Релиз: 2026-02-19 Claude Opus 4.7 Claude Opus 4.7 medium Релиз: 2026-04-16
Оценка 9.0 8.5 9.2 8.7
Ранг #15 #29 #9 #23
Надежность 10.0 10.0 10.0 10.0
Стабильность 8.9 8.6 10.0 9.6
Покрытие бенчмарка 22/22 тестов · 66/66 попыток 22/22 тестов · 66/66 попыток 22/22 тестов · 66/66 попыток 22/22 тестов · 66/66 попыток
Тестов верно
Доля успешных попыток 87.9% 77.3% 90.9% 83.3%
Нестабильные тесты 3 4 0 1
Всего запусков 66 66 66 66
Стоимость за результат 22.980 10.220 6.801 8.201
Общая стоимость $4.137 $1.533 $1.361 $1.477
Цена входа $5.000 / 1M $2.500 / 1M $2.000 / 1M $5.000 / 1M
Цена выхода $30.000 / 1M $15.000 / 1M $12.000 / 1M $25.000 / 1M
Общее число входных токенов 80,659 81,127 92,287 145,252
Выходные токены 5,617 6,155 5,232 24,948
Токены рассуждений 118,819 82,515 92,726 5,042
Время ответа (среднее) 38.42s 23.10s 21.47s 7.61s
Время ответа (макс.) 332.10s 100.41s 88.68s 65.40s
Время ответа (суммарно) 845.35s 508.26s 322.08s 159.91s

Генерация showcase моделей

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#15 GPT-5.5

medium
Стоимость
$0.112
Время
71.9s
Токены
3,807 tok

#29 GPT-5.4

medium
Стоимость
$0.214
Время
199.6s
Токены
14,349 tok

#9 Gemini 3.1 Pro Preview

medium
Стоимость
$0.115
Время
87.2s
Токены
9,629 tok

#23 Claude Opus 4.7

medium
Стоимость
$0.059
Время
26.8s
Токены
2,475 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.5 8.8 7.8 88.9% 1 59.77s 7,305 362 24,959
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114

Быстрое сравнение

Сменить пару сравнения