Эрудиция: Неверный ответ
Эрудиция
Неверный ответ
Посмотрите, какие AI-модели чаще всего сталкиваются с Неверный ответ в Эрудиция, чтобы быстрее находить слабые места.
Причины сбоев
259/259
Фильтровать модели
Нет моделей, соответствующих текущему поиску и фильтрам.
| Ранг | Модель | Компания | Количество Неверный ответ | Оценка категории | Общая стоимость | Тестов верно | Время ответа (среднее) |
|---|---|---|---|---|---|---|---|
| #146 | Grok 4.20 medium | X AI | 1 | 3.0 | $0.805 | 0/1 | 63.5s |
| #147 | Seed-2.0-Mini medium | Bytedance Seed | 1 | 3.0 | $0.116 | 0/1 | 56.8s |
| #148 | Kimi K2.5 medium | Moonshot AI | 1 | 3.0 | $0.479 | 0/1 | 83.9s |
| #149 | KAT-Coder-Pro V2.5 medium | Kwaipilot | 1 | 3.0 | $0.478 | 0/1 | 9.87s |
| #150 | Claude Fable 5.1 low | Anthropic | 1 | 3.0 | $2.565 | 0/1 | 19.2s |
| #151 | Qwen3.7 Flash medium | Qwen | 1 | 3.0 | $0.065 | 0/1 | 29.2s |
| #152 | Seed-2.0-Code high | Bytedance Seed | 1 | 3.0 | $1.273 | 0/1 | 52.2s |
| #153 | Gemini 3.5 Flash none | 1 | 2.8 | $1.093 | 0/1 | 4.87s | |
| #154 | Qwen3.6 Flash medium | Qwen | 1 | 3.0 | $0.741 | 0/1 | 122.9s |
| #157 | Solar Pro 4 low | Upstage | 1 | 3.0 | $0.130 | 0/1 | 69.2s |
| #158 | Solar Pro 4 medium | Upstage | 1 | 3.0 | $0.140 | 0/1 | 108.6s |
| #159 | DeepSeek V4 Pro none | DeepSeek | 1 | 3.0 | $0.351 | 0/1 | 5.76s |
| #160 | GLM 5.3 low | Z.ai | 1 | 3.0 | $0.257 | 0/1 | 7.42s |
| #161 | MiMo-V2.5-Pro medium | Xiaomi | 1 | 3.0 | $0.221 | 0/1 | 12.5s |
| #162 | Mercury 2.5 medium | Inception | 1 | 3.0 | $0.022 | 0/1 | 4.30s |