Навигация
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Сравниваемые модели

Бенчмарк-сравнение Claude Opus 4.6 (medium) vs Claude Sonnet 4.6 (medium) vs GPT-5.3-Codex (medium) vs Gemini 3.1 Pro Preview (medium): GPT-5.3-Codex (medium) лидирует по Оценка со значением 9.1. Claude Opus 4.6 (medium) лидирует по Надежность со значением 10.0. У GPT-5.3-Codex (medium) самый низкий Общая стоимость: $1.318. GPT-5.3-Codex (medium) самый быстрый: 18.87s.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-10-06

Сравниваемые модели

Ранг
#228
Общее число выходных токенов
96,722
Время ответа (среднее)
32.23s
Общая стоимость
$2.961
Ранг
#212
Общее число выходных токенов
120,427
Время ответа (среднее)
28.08s
Общая стоимость
$2.126
Ранг
#34
Общее число выходных токенов
66,287
Время ответа (среднее)
18.87s
Общая стоимость
$1.318
Ранг
#71
Общее число выходных токенов
102,691
Время ответа (среднее)
22.71s
Общая стоимость
$1.585
Рекомендуемая модель GPT-5.3-Codex (medium)

Здесь у него лучший балл (9.1), при этом он примерно в 1.7 раза дешевле, чем другие модели в этом сравнении.

Подробное сравнение

Метрика Claude Opus 4.6 Claude Opus 4.6 medium Релиз: 2026-02-05 Claude Sonnet 4.6 Claude Sonnet 4.6 medium Релиз: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium Релиз: 2026-02-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Релиз: 2026-02-19
Оценка 6.3 6.4 9.1 8.4
Ранг #228 #212 #34 #71
Надежность 10.0 10.0 10.0 9.8
Стабильность 8.5 9.1 8.6 9.6
Попытки 66/69 66/69 69/69 69/69
Тестов верно
Доля успешных попыток 60.9% 62.3% 84.1% 89.9%
Нестабильные тесты 3 1 4 1
Всего запусков 66 66 69 69
Стоимость за результат 22.777 15.182 7.753 7.924
Общая стоимость $2.961 $2.126 $1.318 $1.585
Цена входа $5.000 / 1M $3.000 / 1M $1.750 / 1M $2.000 / 1M
Цена выхода $25.000 / 1M $15.000 / 1M $14.000 / 1M $12.000 / 1M
Цена чтения из кэша $0.500 / 1M $0.300 / 1M $0.175 / 1M $0.200 / 1M
Цена записи в кэш $6.250 / 1M $3.750 / 1M Н/Д $0.375 / 1M
Общее число входных токенов 108,573 106,316 222,794 176,208
Выходные токены 69,994 79,338 7,357 6,093
Токены рассуждений 26,728 41,089 58,930 96,598
Время ответа (среднее) 32.23s 28.08s 18.87s 22.71s
Время ответа (макс.) 151.51s 140.96s 100.93s 88.68s
Время ответа (суммарно) 515.65s 421.15s 433.94s 386.11s
Параметры ~5T всего (~500B активных) ~1T всего (~100B активных) ~1.2T всего (~80B активных) ~1.2T всего (~20B активных)
Доступность Закрытая модель Закрытая модель Закрытая модель Закрытая модель

Цены кэша относятся к входным токенам. Чтение повторно использует сохранённые запросы; запись сохраняет их и может стоить дороже. Выходные токены оплачиваются по цене вывода.

Генерация showcase моделей

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#228 Claude Opus 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
Стоимость
$0.000
Время
300.0s
Токены
0 tok

#212 Claude Sonnet 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
Стоимость
$0.000
Время
300.0s
Токены
0 tok

#34 GPT-5.3-Codex

medium
Стоимость
$0.049
Время
54.9s
Токены
3,580 tok

#71 Gemini 3.1 Pro Preview

medium
Стоимость
$0.115
Время
87.2s
Токены
9,629 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247

Быстрое сравнение

Сменить пару сравнения