AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Сбои по категориям AI BENCHY

Анти-ИИ уловки: Неверный ответ

Анти-ИИ уловки
Неверный ответ

Посмотрите, какие AI-модели чаще всего сталкиваются с Неверный ответ в Анти-ИИ уловки, чтобы быстрее находить слабые места.

Показано моделей

15

Всего сбоев

245

Наиболее затронутая модель

Gemini 2.5 Flash 4
Ранг Модель Компания Количество Неверный ответ Оценка категории Тестов верно Время ответа (среднее)
#158 GLM 4.7 Flash medium Z.ai 2 4.7 1/4 15.0s
#162 Nemotron 3 Nano Omni 30b A3b Reasoning none NVIDIA 2 4.8 1/4 584ms
#163 Granite 4.1 8B none IBM Granite 2 4.9 1/4 844ms
#8 Claude Opus 4.7 none Anthropic 1 8.3 3/4 2.12s
#11 Claude Opus 4.7 medium Anthropic 1 8.3 3/4 1.85s
#13 Grok 4.20 Beta medium X AI 1 8.7 3/4 3.16s
#15 GPT-5.3-Codex medium OpenAI 1 8.7 3/4 4.16s
#19 Seed-2.0-Lite medium Bytedance Seed 1 8.3 3/4 18.0s
#21 GPT-5.4 medium OpenAI 1 8.3 3/4 4.11s
#24 GPT-5.2 Chat none OpenAI 1 8.7 3/4 3.40s
#25 Qwen3.5 Plus 2026-02-15 medium Qwen 1 8.2 3/4 45.8s
#28 Gemini 2.5 Flash medium Google 1 8.4 3/4 6.30s
#31 DeepSeek V4 Flash high DeepSeek 1 8.3 3/4 28.5s
#42 GPT-5.2 medium OpenAI 1 6.5 2/4 7.81s
#45 GPT-5.4 Mini medium OpenAI 1 8.6 3/4 4.05s

Лучшие модели по Количество Неверный ответ

Количество Неверный ответ против Оценка

Лучшие модели по Время ответа (среднее)

Лучшие модели по Оценочная стоимость потерь