AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Сбои по категориям AI BENCHY

Анти-ИИ уловки: Неверный ответ

Анти-ИИ уловки
Неверный ответ

Посмотрите, какие AI-модели чаще всего сталкиваются с Неверный ответ в Анти-ИИ уловки, чтобы быстрее находить слабые места. Сортировать по: Число сбоев ↑.

Показано моделей

15

Всего сбоев

245

Наиболее затронутая модель

Claude Opus 4.7 1
Ранг Модель Компания Количество Неверный ответ Оценка категории Тестов верно Время ответа (среднее)
#8 Claude Opus 4.7 none Anthropic 1 8.3 3/4 2.12s
#11 Claude Opus 4.7 medium Anthropic 1 8.3 3/4 1.85s
#13 Grok 4.20 Beta medium X AI 1 8.7 3/4 3.16s
#15 GPT-5.3-Codex medium OpenAI 1 8.7 3/4 4.16s
#19 Seed-2.0-Lite medium Bytedance Seed 1 8.3 3/4 18.0s
#21 GPT-5.4 medium OpenAI 1 8.3 3/4 4.11s
#24 GPT-5.2 Chat none OpenAI 1 8.7 3/4 3.40s
#25 Qwen3.5 Plus 2026-02-15 medium Qwen 1 8.2 3/4 45.8s
#28 Gemini 2.5 Flash medium Google 1 8.4 3/4 6.30s
#31 DeepSeek V4 Flash high DeepSeek 1 8.3 3/4 28.5s
#42 GPT-5.2 medium OpenAI 1 6.5 2/4 7.81s
#45 GPT-5.4 Mini medium OpenAI 1 8.6 3/4 4.05s
#48 Gemini 3 Flash Preview none Google 1 8.3 3/4 1.25s
#50 Gemini 3.1 Flash Lite Preview low Google 1 8.3 3/4 2.12s
#52 Claude Sonnet 4.6 medium Anthropic 1 6.5 2/4 2.98s

Лучшие модели по Количество Неверный ответ

Количество Неверный ответ против Оценка

Лучшие модели по Время ответа (среднее)

Лучшие модели по Оценочная стоимость потерь