Сбои по категориям AI BENCHY
Эрудиция: Неверный ответ
Эрудиция
Неверный ответ
Посмотрите, какие AI-модели чаще всего сталкиваются с Неверный ответ в Эрудиция, чтобы быстрее находить слабые места. Сортировать по: Общая стоимость ↓.
Причины сбоев
133/133
Фильтровать модели
Нет моделей, соответствующих текущему поиску и фильтрам.
| Ранг | Модель | Компания | Количество Неверный ответ | Оценка категории | Общая стоимость | Тестов верно | Время ответа (среднее) |
|---|---|---|---|---|---|---|---|
| #9 | GPT-5.5 medium | OpenAI | 1 | 2.8 | $3.679 | 0/1 | 37.9s |
| #38 | Claude Opus 4.6 medium | Anthropic | 1 | 3.0 | $2.053 | 0/1 | 63.2s |
| #31 | Claude Sonnet 4.6 medium | Anthropic | 1 | 3.0 | $1.418 | 0/1 | 30.1s |
| #17 | GPT-5.4 medium | OpenAI | 1 | 3.0 | $1.210 | 0/1 | 14.0s |
| #66 | Gemini 3.5 Flash none | 1 | 2.8 | $1.079 | 0/1 | 4.87s | |
| #11 | Qwen3.6 Max Preview medium | Qwen | 1 | 3.0 | $0.960 | 0/1 | 60.6s |
| #42 | Grok Build 0.1 medium | X AI | 1 | 3.0 | $0.927 | 0/1 | 53.5s |
| #4 | GPT-5.5 low | OpenAI | 1 | 3.0 | $0.907 | 0/1 | 10.1s |
| #35 | Kimi K2.6 medium | Moonshot AI | 1 | 3.0 | $0.889 | 0/1 | 130.3s |
| #10 | GPT-5.3-Codex medium | OpenAI | 1 | 2.8 | $0.740 | 0/1 | 14.4s |
| #73 | Mimo V2 Omni medium | Xiaomi | 1 | 3.0 | $0.683 | 0/1 | 234.2s |
| #13 | Claude Opus 4.7 medium | Anthropic | 1 | 3.0 | $0.679 | 0/1 | 2.25s |
| #37 | Grok 4.3 medium | X AI | 1 | 3.0 | $0.614 | 0/1 | 44.5s |
| #53 | Grok 4.20 medium | X AI | 1 | 3.0 | $0.609 | 0/1 | 63.5s |
| #36 | Qwen3.5-122B-A10B medium | Qwen | 1 | 3.0 | $0.588 | 0/1 | 52.9s |