Навигация
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Grok 4.20 (medium) vs GLM 5.1 (medium)

Средний балл практически равен: 7.0 vs 7.0. GLM 5.1 (medium) имеет более низкую стоимость benchmark: $0.727 vs $0.805. Grok 4.20 (medium) быстрее: 32.56s vs 58.80s, с долей успешных попыток 60.6% vs 65.2%.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-08-15

Ранг
#120
Общее число выходных токенов
270,259
Время ответа (среднее)
32.56s
Общая стоимость
$0.805
Ранг
#117
Общее число выходных токенов
215,889
Время ответа (среднее)
58.80s
Общая стоимость
$0.727
Рекомендуемая модель Grok 4.20 (medium)

Здесь у него лучший балл (7.0), и он отвечает примерно в 1.8 раза быстрее, чем GLM 5.1 (medium).

Подробное сравнение

Метрика Grok 4.20 Grok 4.20 medium Релиз: 2026-03-31 GLM 5.1 GLM 5.1 medium Релиз: 2026-04-07
Оценка 7.0 7.0
Ранг #120 #117
Надежность 10.0 8.1
Стабильность 8.2 8.4
Попытки 66/66 66/66
Тестов верно
Доля успешных попыток 60.6% 65.2%
Нестабильные тесты 5 4
Всего запусков 66 66
Стоимость за результат 10.365 6.923
Общая стоимость $0.805 $0.727
Цена входа $1.250 / 1M $0.966 / 1M
Цена выхода $2.500 / 1M $3.036 / 1M
Общее число входных токенов 102,986 82,592
Выходные токены 5,860 16,089
Токены рассуждений 264,399 199,800
Время ответа (среднее) 32.56s 58.80s
Время ответа (макс.) 199.66s 308.75s
Время ответа (суммарно) 716.36s 1234.72s
Параметры ~1T всего (~100B активных) 744B всего (40B активных)
Доступность Закрытая модель Открытый исходный код

Генерация showcase моделей

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#120 SpaceXAI: Grok 4.20

medium
Стоимость
$0.041
Время
110.3s
Токены
16,336 tok

#117 GLM 5.1

medium
Неверный SVG
Стоимость
$0.000
Время
300.0s
Токены
0 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150
GLM 5.1 4.6 3.7 44.5% 2 109.63s 5,702 4,871 37,826

Быстрое сравнение

Сменить пару сравнения