Следование инструкциям: Неверный ответ
Следование инструкциям
Неверный ответ
Посмотрите, какие AI-модели чаще всего сталкиваются с Неверный ответ в Следование инструкциям, чтобы быстрее находить слабые места.
Причины сбоев
82/82
Фильтровать модели
Нет моделей, соответствующих текущему поиску и фильтрам.
| Ранг | Модель | Компания | Количество Неверный ответ | Оценка категории | Общая стоимость | Тестов верно | Время ответа (среднее) |
|---|---|---|---|---|---|---|---|
| #104 | LongCat 2.0 medium | Meituan | 1 | 6.5 | $0.499 | 1/2 | 7.38s |
| #108 | Claude Sonnet 4.6 none | Anthropic | 1 | 6.5 | $0.661 | 1/2 | 1.96s |
| #113 | Qwen3.7 Plus none | Qwen | 1 | 6.3 | $0.106 | 1/2 | 929ms |
| #129 | GLM 5.1 medium | Z.ai | 1 | 6.4 | $0.727 | 1/2 | 7.47s |
| #130 | GPT-5.5 none | OpenAI | 1 | 6.2 | $0.544 | 1/2 | 1.15s |
| #137 | Qwen3.7 Flash medium | Qwen | 1 | 5.8 | $0.065 | 0/2 | 9.27s |
| #145 | DeepSeek V4 Pro none | DeepSeek | 1 | 6.3 | $0.226 | 1/2 | 4.12s |
| #148 | Gemini 3 Flash Preview none | 1 | 6.4 | $0.085 | 1/2 | 1.58s | |
| #152 | LongCat 2.0 low | Meituan | 1 | 6.5 | $0.412 | 1/2 | 6.39s |
| #153 | Gemini 3.5 Flash minimal | 1 | 6.4 | $0.300 | 1/2 | 893ms | |
| #155 | LongCat 2.0 high | Meituan | 1 | 6.5 | $0.492 | 1/2 | 6.96s |
| #158 | Qwen3.5-27B none | Qwen | 1 | 6.3 | $0.058 | 1/2 | 1.03s |
| #172 | LongCat 2.0 none | Meituan | 1 | 6.5 | $0.044 | 1/2 | 2.82s |
| #185 | Qwen3.7 Flash none | Qwen | 1 | 6.3 | $0.019 | 1/2 | 892ms |
| #189 | Trinity Large Thinking medium | Arcee AI | 1 | 4.4 | $0.756 | 0/2 | 3.99s |