AI BENCHY
Advertise here

Сбои AI BENCHY

Сбои: Неверный ответ

Посмотрите, какие AI-модели чаще всего сталкиваются с Неверный ответ, чтобы заранее заметить риски надежности. Сортировать по: Время ответа (среднее) ↓.

Показано моделей

15

Всего сбоев

1204

Наиболее затронутая модель

Kimi K2.5 5
Ранг Модель Компания Количество Неверный ответ Оценка Тестов верно Время ответа (среднее)
#39 Qwen3.6 Flash medium Qwen 8 7.5 12/21 19.2s
#1 Gemini 3 Flash Preview medium Google 1 9.8 20/21 18.6s
#46 Qwen3.6 35B A3B medium Qwen 4 7.4 13/21 18.1s
#149 Nemotron 3 Nano Omni 30b A3b Reasoning medium NVIDIA 7 4.6 4/19 17.1s
#52 Claude Sonnet 4.6 medium Anthropic 4 7.4 13/21 17.1s
#42 GPT-5.2 medium OpenAI 3 7.5 13/21 16.9s
#33 Hy3 preview medium Tencent 3 7.7 14/21 16.3s
#15 GPT-5.3-Codex medium OpenAI 4 8.4 15/21 16.2s
#5 Qwen3.7 Max medium Qwen 3 9.1 18/21 16.0s
#57 Step 3.7 Flash low Stepfun 8 7.3 12/21 15.7s
#28 Gemini 2.5 Flash medium Google 6 7.8 14/21 15.5s
#93 Qwen3.6 Plus Preview medium Qwen 2 6.3 9/19 15.2s
#41 Nemotron 3 Ultra 550b A55b medium NVIDIA 7 7.5 13/21 15.1s
#92 Laguna M.1 medium Poolside 4 6.4 9/19 14.7s
#133 DeepSeek V3.2 none DeepSeek 7 5.2 6/21 13.8s

Лучшие модели по Количество Неверный ответ

Количество Неверный ответ против Оценка

Лучшие модели по Время ответа (среднее)