AI BENCHY
Your ad here

Сбои по категориям AI BENCHY

Предметно-ориентированное: Неверный ответ

Предметно-ориентированное
Неверный ответ

Посмотрите, какие AI-модели чаще всего сталкиваются с Неверный ответ в Предметно-ориентированное, чтобы быстрее находить слабые места.

Показано моделей

15

Всего сбоев

182

Наиболее затронутая модель

Qwen3.6 Plus Preview 3
Ранг Модель Компания Количество Неверный ответ Оценка категории Тестов верно Время ответа (среднее)
#32 Qwen3.5-Flash medium Qwen 1 5.3 1/3 146.5s
#33 GLM 5.1 medium Z.ai 1 5.3 1/3 29.8s
#35 MiMo-V2-Omni medium Xiaomi 1 3.0 0/3 55.1s
#37 Claude Opus 4.6 medium Anthropic 1 3.0 0/3 83.4s
#40 GPT-5.2 medium OpenAI 1 5.9 1/3 77.8s
#42 Claude Sonnet 4.6 none Anthropic 1 7.7 2/3 3.54s
#43 Qwen3.5-35B-A3B medium Qwen 1 4.1 0/3 88.3s
#47 Grok 4.20 medium X AI 1 5.3 1/3 27.0s
#48 Gemma 4 31B none Google 1 7.7 2/3 3.22s
#50 Hunter Alpha medium OpenRouter 1 3.0 0/3 10.5s
#52 Grok 4.1 Fast medium X AI 1 5.8 1/3 121.8s
#57 GPT-5 Nano medium OpenAI 1 5.2 1/3 204.0s
#59 Qwen3.5-Flash none Qwen 1 7.7 2/3 905ms
#63 Qwen3.5-35B-A3B none Qwen 1 7.7 2/3 485ms
#73 Mistral Small 4 medium Mistral 1 5.3 1/3 6.11s

Лучшие модели по Количество Неверный ответ

Количество Неверный ответ против Оценка

Лучшие модели по Время ответа (среднее)

Лучшие модели по Оценочная стоимость потерь