Рейтинг сбоев по Не соблюдены инструкции

Посмотрите, какие AI-модели чаще всего сталкиваются с Не соблюдены инструкции, чтобы заранее заметить риски надежности. Сортировать по: Тестов верно ↓.

Показано моделей

Всего сбоев

245

Наиболее затронутая модель

Gemini 3.5 Flash 1

Категории

В категории Решение головоломок90 В категории Общий интеллект78 В категории Анти-ИИ уловки33 В категории Следование инструкциям18 В категории Программирование16 В категории Вызов инструментов8 В категории Комбинированный1 В категории Предметно-ориентированное1

140/140

Ранг	Модель	Компания	Количество Не соблюдены инструкции	Оценка	Общая стоимость	Тестов верно	Время ответа (среднее)
#104	Gemini 3.1 Flash Lite Preview low	Google	1	6.5	$0.646	13/22	16.7s
Всего тестов 22 Ошибочных тестов 9 Общая стоимость $0.646 Время ответа (среднее) 16.7s
#109	Mimo V2 PRO medium	Xiaomi	1	6.3	$0.333	12/21	22.2s
Всего тестов 21 Ошибочных тестов 9 Общая стоимость $0.333 Время ответа (среднее) 22.2s
#113	MiMo-V2-Flash medium	Xiaomi	1	6.3	$0.043	12/21	20.1s
Всего тестов 21 Ошибочных тестов 9 Общая стоимость $0.043 Время ответа (среднее) 20.1s
#143	Gemini 3.1 Flash Lite high	Google	3	5.6	$2.044	10/18	62.0s
Всего тестов 18 Ошибочных тестов 8 Общая стоимость $2.044 Время ответа (среднее) 62.0s
#26	GPT-5 Mini medium	OpenAI	3	8.1	$0.237	12/22	27.6s
Всего тестов 22 Ошибочных тестов 10 Общая стоимость $0.237 Время ответа (среднее) 27.6s
#27	Muse Spark 1.1 high	Meta	2	8.1	$1.694	12/22	31.5s
Всего тестов 22 Ошибочных тестов 10 Общая стоимость $1.694 Время ответа (среднее) 31.5s
#47	MiniMax M3 medium	Minimax	2	7.6	$0.286	12/22	75.0s
Всего тестов 22 Ошибочных тестов 10 Общая стоимость $0.286 Время ответа (среднее) 75.0s
#52	Kimi K2.7 Code medium	Moonshot AI	1	7.5	$0.751	12/22	84.2s
Всего тестов 22 Ошибочных тестов 10 Общая стоимость $0.751 Время ответа (среднее) 84.2s
#53	GPT-5.4 Nano medium	OpenAI	2	7.5	$0.138	12/22	13.2s
Всего тестов 22 Ошибочных тестов 10 Общая стоимость $0.138 Время ответа (среднее) 13.2s
#56	GPT-5.4 Mini medium	OpenAI	3	7.5	$0.756	12/22	25.9s
Всего тестов 22 Ошибочных тестов 10 Общая стоимость $0.756 Время ответа (среднее) 25.9s
#63	Claude Sonnet 4.6 none	Anthropic	1	7.3	$0.661	12/22	8.12s
Всего тестов 22 Ошибочных тестов 10 Общая стоимость $0.661 Время ответа (среднее) 8.12s
#68	Kimi K2.6 medium	Moonshot AI	2	7.2	$1.036	12/22	110.0s
Всего тестов 22 Ошибочных тестов 10 Общая стоимость $1.036 Время ответа (среднее) 110.0s
#75	Grok 4.20 medium	X AI	2	7.1	$0.777	12/22	29.5s
Всего тестов 22 Ошибочных тестов 10 Общая стоимость $0.777 Время ответа (среднее) 29.5s
#84	MiMo-V2.5-Pro medium	Xiaomi	2	6.9	$0.187	12/22	33.9s
Всего тестов 22 Ошибочных тестов 10 Общая стоимость $0.187 Время ответа (среднее) 33.9s
#85	Qwen3.6 Flash medium	Qwen	1	6.9	$0.738	12/22	44.7s
Всего тестов 22 Ошибочных тестов 10 Общая стоимость $0.738 Время ответа (среднее) 44.7s

Сбои: Не соблюдены инструкции

Фильтровать модели

Лучшие модели по Количество Не соблюдены инструкции

Количество Не соблюдены инструкции против Оценка

Лучшие модели по Время ответа (среднее)