AI BENCHY
Advertise here

Сбои AI BENCHY

Сбои: Не соблюдены инструкции

Посмотрите, какие AI-модели чаще всего сталкиваются с Не соблюдены инструкции, чтобы заранее заметить риски надежности. Сортировать по: Оценка ↓.

Показано моделей

15

Всего сбоев

215

Наиболее затронутая модель

Gemini 3.5 Flash 1
Ранг Модель Компания Количество Не соблюдены инструкции Оценка Тестов верно Время ответа (среднее)
#7 Gemini 3.5 Flash medium Google 1 9.0 18/21 4.94s
#12 Gemini 3.1 Flash Lite Preview high Google 1 8.6 13/16 68.1s
#13 Grok 4.20 Beta medium X AI 1 8.5 14/18 9.75s
#15 GPT-5.3-Codex medium OpenAI 2 8.4 15/21 16.2s
#17 GLM 5 medium Z.ai 1 8.3 15/21 33.5s
#19 Seed-2.0-Lite medium Bytedance Seed 2 8.2 14/21 47.1s
#21 GPT-5.4 medium OpenAI 2 8.0 14/21 22.3s
#22 Step 3.7 Flash medium Stepfun 1 8.0 14/21 20.4s
#23 GLM 5 Turbo medium Z.ai 1 8.0 14/21 23.0s
#24 GPT-5.2 Chat none OpenAI 1 7.9 14/21 7.13s
#26 Qwen3.6 Plus medium Qwen 1 7.9 14/21 30.7s
#28 Gemini 2.5 Flash medium Google 1 7.8 14/21 15.5s
#30 Qwen3.5-27B medium Qwen 2 7.8 13/21 68.4s
#31 DeepSeek V4 Flash high DeepSeek 2 7.7 13/21 45.8s
#32 Gemini 3.5 Flash minimal Google 1 7.7 14/21 1.57s

Лучшие модели по Количество Не соблюдены инструкции

Количество Не соблюдены инструкции против Оценка

Лучшие модели по Время ответа (среднее)