Сбои AI BENCHY
Сбои: Неверный ответ
Посмотрите, какие AI-модели чаще всего сталкиваются с Неверный ответ, чтобы заранее заметить риски надежности. Сортировать по: Тестов верно ↑.
Категории
В категории Предметно-ориентированное314 В категории Анти-ИИ уловки245 В категории Программирование194 В категории Решение головоломок147 В категории Эрудиция130 В категории Следование инструкциям53 В категории Комбинированный52 В категории Парсинг и извлечение данных35 В категории Общий интеллект32 В категории Вызов инструментов2
| Ранг | Модель | Компания | Количество Неверный ответ | Оценка | Тестов верно | Время ответа (среднее) |
|---|---|---|---|---|---|---|
| #108 | Qwen3.5-Flash none | Qwen | 13 | 5.8 | 8/21 | 3.58s |
| #109 | GLM 5V Turbo none | Z.ai | 11 | 5.8 | 8/21 | 2.99s |
| #110 | Seed-2.0-Lite none | Bytedance Seed | 13 | 5.8 | 8/21 | 2.49s |
| #111 | Owl Alpha medium | Openrouter | 10 | 5.7 | 8/21 | 11.9s |
| #90 | Gemini 3.1 Flash Lite none | 11 | 6.4 | 9/21 | 1.06s | |
| #94 | GPT-5 Nano medium | OpenAI | 9 | 6.3 | 9/21 | 42.5s |
| #95 | Qwen3.5 Plus 2026-02-15 none | Qwen | 12 | 6.3 | 9/21 | 2.31s |
| #96 | Ring-2.6-1T none | Inclusionai | 5 | 6.2 | 9/21 | 55.1s |
| #97 | Gemini 2.5 Flash none | 12 | 6.2 | 9/21 | 875ms | |
| #98 | GLM 5 none | Z.ai | 12 | 6.1 | 9/21 | 4.03s |
| #99 | gpt-oss-120b medium | OpenAI | 9 | 6.1 | 9/21 | 22.3s |
| #79 | Hunter Alpha medium | OpenRouter | 4 | 6.7 | 8/18 | 10.3s |
| #84 | Grok 4.20 Multi Agent Beta medium | X AI | 4 | 6.6 | 8/18 | 9.69s |
| #86 | Grok 4.1 Fast medium | X AI | 4 | 6.5 | 9/19 | 23.8s |
| #92 | Laguna M.1 medium | Poolside | 4 | 6.4 | 9/19 | 14.7s |