Навигация
AI BENCHY
Advertise here

Сравниваемые модели

Бенчмарк-сравнение Grok 4.20 (medium) vs Grok 4.20 Beta (medium) vs Grok 4.3 (medium): Grok 4.3 (medium) лидирует по Оценка со значением 7.1. Grok 4.20 (medium) лидирует по Надежность со значением 10.0. У Grok 4.20 Beta (medium) самый низкий Общая стоимость: $0.750. Grok 4.20 Beta (medium) самый быстрый: 9.75s.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-08-01

Ранг
#90
Общее число выходных токенов
259,340
Время ответа (среднее)
29.47s
Общая стоимость
$0.777
Ранг
#152
Общее число выходных токенов
93,212
Время ответа (среднее)
9.75s
Общая стоимость
$0.750
Ранг
#88
Общее число выходных токенов
241,421
Время ответа (среднее)
47.45s
Общая стоимость
$0.779
Рекомендуемая модель Grok 4.20 (medium)

У него самый высокий балл в этом сравнении (7.1) и лучший общий баланс стоимости и времени ответа среди всех 3 моделей.

Подробное сравнение

Метрика Grok 4.20 Grok 4.20 medium Релиз: 2026-03-31 Grok 4.20 Beta Grok 4.20 Beta medium Релиз: 2026-03-12 Grok 4.3 Grok 4.3 medium Релиз: 2026-05-01
Оценка 7.1 6.0 7.1
Ранг #90 #152 #88
Надежность 10.0 Н/Д 10.0
Стабильность 8.5 7.8 8.6
Тестов верно
Доля успешных попыток 63.6% 66.7% 68.2%
Нестабильные тесты 4 1 4
Всего запусков 66 52 66
Стоимость за результат 9.709 4.505 5.990
Общая стоимость $0.777 $0.750 $0.779
Цена входа $1.250 / 1M $5.805 / 1M $1.250 / 1M
Цена выхода $2.500 / 1M $5.805 / 1M $2.500 / 1M
Общее число входных токенов 102,791 35,955 140,031
Выходные токены 5,363 1,647 13,739
Токены рассуждений 253,977 91,565 227,682
Время ответа (среднее) 29.47s 9.75s 47.45s
Время ответа (макс.) 199.66s 31.36s 216.69s
Время ответа (суммарно) 648.35s 175.48s 1043.83s

Генерация showcase моделей

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#90 xAI: Grok 4.20

medium
Стоимость
$0.041
Время
110.3s
Токены
16,336 tok

#152 Grok 4.20 Beta

medium
Стоимость
$0.034
Время
91.0s
Токены
13,523 tok

#88 xAI: Grok 4.3

medium
Стоимость
$0.009
Время
19.0s
Токены
3,661 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150
Grok 4.20 Beta 3.3 3.3 33.3% 0 31.36s 360 81 3,987
Grok 4.3 5.9 7.7 44.4% 1 41.23s 8,340 1,028 31,226

Быстрое сравнение

Сменить пару сравнения