Навигация
AI BENCHY
Advertise here

Сравниваемые модели

Бенчмарк-сравнение Claude Opus 4.6 (medium) vs Claude Sonnet 4.6 (medium) vs GPT-5.3-Codex (medium) vs Gemini 3.1 Pro Preview (medium): Gemini 3.1 Pro Preview (medium) лидирует по Оценка со значением 9.2. Claude Opus 4.6 (medium) лидирует по Надежность со значением 10.0. У GPT-5.3-Codex (medium) самый низкий Общая стоимость: $0.920. GPT-5.3-Codex (medium) самый быстрый: 16.96s.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-08-07

Ранг
#60
Общее число выходных токенов
100,601
Время ответа (среднее)
34.27s
Общая стоимость
$3.059
Ранг
#56
Общее число выходных токенов
115,865
Время ответа (среднее)
25.91s
Общая стоимость
$2.057
Ранг
#18
Общее число выходных токенов
55,525
Время ответа (среднее)
16.96s
Общая стоимость
$0.920
Ранг
#9
Общее число выходных токенов
97,958
Время ответа (среднее)
21.47s
Общая стоимость
$1.361
Рекомендуемая модель GPT-5.3-Codex (medium)

Его балл близок к лучшему здесь (8.9 против 9.2), при этом он примерно в 2.3 раза дешевле, чем другие модели в этом сравнении.

Подробное сравнение

Метрика Claude Opus 4.6 Claude Opus 4.6 medium Релиз: 2026-02-05 Claude Sonnet 4.6 Claude Sonnet 4.6 medium Релиз: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium Релиз: 2026-02-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Релиз: 2026-02-19
Оценка 7.7 7.8 8.9 9.2
Ранг #60 #56 #18 #9
Надежность 10.0 10.0 10.0 10.0
Стабильность 8.8 9.2 8.6 10.0
Покрытие бенчмарка 22/22 тестов · 66/66 попыток 22/22 тестов · 66/66 попыток 22/22 тестов · 66/66 попыток 22/22 тестов · 66/66 попыток
Тестов верно
Доля успешных попыток 63.6% 66.7% 83.3% 90.9%
Нестабильные тесты 3 2 4 0
Всего запусков 66 66 66 66
Стоимость за результат 23.524 14.692 5.748 6.801
Общая стоимость $3.059 $2.057 $0.920 $1.361
Цена входа $5.000 / 1M $3.000 / 1M $1.750 / 1M $2.000 / 1M
Цена выхода $25.000 / 1M $15.000 / 1M $14.000 / 1M $12.000 / 1M
Общее число входных токенов 108,615 106,292 81,268 92,287
Выходные токены 72,286 80,748 6,251 5,232
Токены рассуждений 28,315 35,117 49,274 92,726
Время ответа (среднее) 34.27s 25.91s 16.96s 21.47s
Время ответа (макс.) 151.51s 140.96s 100.93s 88.68s
Время ответа (суммарно) 513.99s 362.78s 373.19s 322.08s

Генерация showcase моделей

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#60 Claude Opus 4.6

medium
Неверный SVG
Стоимость
$0.000
Время
300.0s
Токены
0 tok

#56 Claude Sonnet 4.6

medium
Неверный SVG
Стоимость
$0.000
Время
300.0s
Токены
0 tok

#18 GPT-5.3-Codex

medium
Стоимость
$0.049
Время
54.9s
Токены
3,580 tok

#9 Gemini 3.1 Pro Preview

medium
Стоимость
$0.115
Время
87.2s
Токены
9,629 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247

Быстрое сравнение

Сменить пару сравнения