Рейтинг сбоев по Неверный ответ

Посмотрите, какие AI-модели чаще всего сталкиваются с Неверный ответ, чтобы заранее заметить риски надежности. Сортировать по: Число сбоев ↑.

Показано моделей

Всего сбоев

1558

Наиболее затронутая модель

Gemini 3 Flash Preview 1

Категории

209/209

Ранг	Модель	Компания	Количество Неверный ответ	Оценка	Общая стоимость	Тестов верно	Время ответа (среднее)
#14	Claude Opus 4.8 medium	Anthropic	3	8.8	$1.931	18/22	12.5s
Всего тестов 22 Ошибочных тестов 4 Общая стоимость $1.931 Время ответа (среднее) 12.5s
#15	Claude Opus 4.7 medium	Anthropic	3	8.7	$1.477	18/22	7.61s
Всего тестов 22 Ошибочных тестов 4 Общая стоимость $1.477 Время ответа (среднее) 7.61s
#21	GPT-5.2 medium	OpenAI	3	8.4	$0.951	14/22	22.6s
Всего тестов 22 Ошибочных тестов 8 Общая стоимость $0.951 Время ответа (среднее) 22.6s
#31	GLM 5.2 high	Z.ai	3	8.0	$0.970	14/22	62.7s
Всего тестов 22 Ошибочных тестов 8 Общая стоимость $0.970 Время ответа (среднее) 62.7s
#38	GLM 5.2 medium	Z.ai	3	7.8	$0.222	15/21	23.3s
Всего тестов 21 Ошибочных тестов 6 Общая стоимость $0.222 Время ответа (среднее) 23.3s
#42	GLM 5 medium	Z.ai	3	7.7	$0.307	15/21	33.5s
Всего тестов 21 Ошибочных тестов 6 Общая стоимость $0.307 Время ответа (среднее) 33.5s
#43	Claude Opus 4.6 medium	Anthropic	3	7.7	$3.059	13/22	34.3s
Всего тестов 22 Ошибочных тестов 9 Общая стоимость $3.059 Время ответа (среднее) 34.3s
#47	MiniMax M3 medium	Minimax	3	7.6	$0.286	12/22	75.0s
Всего тестов 22 Ошибочных тестов 10 Общая стоимость $0.286 Время ответа (среднее) 75.0s
#68	Kimi K2.6 medium	Moonshot AI	3	7.2	$1.036	12/22	110.0s
Всего тестов 22 Ошибочных тестов 10 Общая стоимость $1.036 Время ответа (среднее) 110.0s
#79	Gemini 3.5 Flash none	Google	3	7.0	$1.079	15/22	9.93s
Всего тестов 22 Ошибочных тестов 7 Общая стоимость $1.079 Время ответа (среднее) 9.93s
#84	MiMo-V2.5-Pro medium	Xiaomi	3	6.9	$0.187	12/22	33.9s
Всего тестов 22 Ошибочных тестов 10 Общая стоимость $0.187 Время ответа (среднее) 33.9s
#94	Claude Opus 4.7 none	Anthropic	3	6.6	$0.505	16/19	3.02s
Всего тестов 19 Ошибочных тестов 3 Общая стоимость $0.505 Время ответа (среднее) 3.02s
#95	Gemma 4 26B A4B medium	Google	3	6.6	$0.089	14/22	103.8s
Всего тестов 22 Ошибочных тестов 8 Общая стоимость $0.089 Время ответа (среднее) 103.8s
#100	Hy3 preview medium	Tencent	3	6.5	$0.018	14/21	16.3s
Всего тестов 21 Ошибочных тестов 7 Общая стоимость $0.018 Время ответа (среднее) 16.3s
#131	Grok 4.20 Beta medium	X AI	3	6.0	$0.750	14/18	9.75s
Всего тестов 18 Ошибочных тестов 4 Общая стоимость $0.750 Время ответа (среднее) 9.75s

Сбои: Неверный ответ

Фильтровать модели

Лучшие модели по Количество Неверный ответ

Количество Неверный ответ против Оценка

Лучшие модели по Время ответа (среднее)