AI BENCHY
Your ad here

Сбои AI BENCHY

Сбои: Неверный ответ

Посмотрите, какие AI-модели чаще всего сталкиваются с Неверный ответ, чтобы заранее заметить риски надежности. Сортировать по: Число сбоев ↑.

Показано моделей

7

Всего сбоев

572

Наиболее затронутая модель

Gemini 3.1 Pro Preview 1
Ранг Модель Компания Количество Неверный ответ Оценка Тестов верно Время ответа (среднее)
#76 Kimi K2.5 none Moonshot AI 12 5.5 6/18 13.4s
#87 Qwen3 Coder Next none Qwen 12 5.1 4/18 10.2s
#94 MiMo-V2-Flash none Xiaomi 12 4.5 3/18 2.79s
#89 GPT-4o-mini none OpenAI 13 4.9 4/18 2.00s
#91 Mercury 2 none Inception 13 4.8 4/18 613ms
#95 Grok 4.1 Fast none X AI 13 4.5 3/18 1.76s
#96 GPT-5.4 Nano none OpenAI 13 4.5 2/18 1.40s

Лучшие модели по Количество Неверный ответ

Количество Неверный ответ против Оценка

Лучшие модели по Время ответа (среднее)