AI BENCHY
Advertise here

Сбои по категориям AI BENCHY

Следование инструкциям: Неверный ответ

Следование инструкциям
Неверный ответ

Посмотрите, какие AI-модели чаще всего сталкиваются с Неверный ответ в Следование инструкциям, чтобы быстрее находить слабые места.

Показано моделей

8

Всего сбоев

53

Наиболее затронутая модель

Gemini 3.5 Flash 1
Ранг Модель Компания Количество Неверный ответ Оценка категории Тестов верно Время ответа (среднее)
#154 Qwen3.5-9B none Qwen 1 6.5 1/2 514ms
#155 Mercury 2 none Inception 1 6.5 1/2 551ms
#157 Grok 4.1 Fast none X AI 1 3.0 0/2 685ms
#158 GLM 4.7 Flash medium Z.ai 1 6.2 1/2 2.97s
#159 Ling-2.6-1T none Inclusionai 1 6.4 1/2 5.36s
#160 LFM2-24B-A2B none Liquid 1 6.3 1/2 752ms
#162 Nemotron 3 Nano Omni 30b A3b Reasoning none NVIDIA 1 4.8 0/2 541ms
#163 Granite 4.1 8B none IBM Granite 1 3.6 0/2 344ms

Лучшие модели по Количество Неверный ответ

Количество Неверный ответ против Оценка

Лучшие модели по Время ответа (среднее)

Лучшие модели по Оценочная стоимость потерь