AI BENCHY
Your ad here

Сбои по категориям AI BENCHY

Комбинированный: Неверный ответ

Комбинированный
Неверный ответ

Посмотрите, какие AI-модели чаще всего сталкиваются с Неверный ответ в Комбинированный, чтобы быстрее находить слабые места.

Показано моделей

7

Всего сбоев

37

Наиболее затронутая модель

Gemini 3 Flash Preview 1
Ранг Модель Компания Количество Неверный ответ Оценка категории Тестов верно Время ответа (среднее)
#88 Nemotron 3 Super none NVIDIA 1 3.0 0/1 20.0s
#89 GPT-4o-mini none OpenAI 1 3.0 0/1 7.58s
#91 Mercury 2 none Inception 1 3.0 0/1 606ms
#92 Qwen3 Coder Next medium Qwen 1 3.0 0/1 4.28s
#94 MiMo-V2-Flash none Xiaomi 1 3.0 0/1 2.87s
#95 Grok 4.1 Fast none X AI 1 3.0 0/1 3.33s
#96 GPT-5.4 Nano none OpenAI 1 3.0 0/1 3.84s

Лучшие модели по Количество Неверный ответ

Количество Неверный ответ против Оценка

Лучшие модели по Время ответа (среднее)

Лучшие модели по Оценочная стоимость потерь