AI BENCHY
Your ad here

Fallos por categoría de AI BENCHY

Trucos anti-IA: Respuesta incorrecta

Trucos anti-IA
Respuesta incorrecta

Mira qué modelos de IA tienen más probabilidades de caer en Respuesta incorrecta dentro de Trucos anti-IA, para detectar puntos débiles más rápido. Ordenar por: Pruebas correctas ↓.

Modelos mostrados

15

Fallos totales

189

Modelo más afectado

Claude Opus 4.7 1
Rango Modelo Empresa Cantidad de Respuesta incorrecta Puntuación de categoría Pruebas correctas Tiempo de respuesta (promedio)
#3 Claude Opus 4.7 medium Anthropic 1 8.3 3/4 1.85s
#4 Claude Opus 4.7 none Anthropic 1 8.3 3/4 2.12s
#8 Seed-2.0-Lite medium Bytedance Seed 1 8.3 3/4 18.0s
#9 GPT-5.3-Codex medium OpenAI 1 8.7 3/4 4.16s
#10 Qwen3.5 Plus 2026-02-15 medium Qwen 1 8.2 3/4 45.8s
#18 Gemini 2.5 Flash medium Google 1 8.4 3/4 6.30s
#19 GPT-5.4 medium OpenAI 1 8.3 3/4 4.11s
#25 Gemini 3 Flash Preview none Google 1 8.3 3/4 1.25s
#26 Gemini 3.1 Flash Lite Preview low Google 1 8.3 3/4 2.12s
#31 Grok 4.20 Beta medium X AI 1 8.7 3/4 3.16s
#33 DeepSeek V3.2 medium DeepSeek 1 8.4 3/4 30.7s
#34 GPT-5.2 Chat none OpenAI 1 8.7 3/4 3.40s
#37 DeepSeek V4 Flash high DeepSeek 1 8.3 3/4 28.5s
#46 GPT-5.4 Nano medium OpenAI 1 8.3 3/4 4.52s
#52 GPT-5.4 Mini medium OpenAI 1 8.6 3/4 4.05s

Mejores modelos por Cantidad de Respuesta incorrecta

Cantidad de Respuesta incorrecta vs Puntuación

Mejores modelos por Tiempo de respuesta (promedio)

Mejores modelos por Costo desperdiciado estimado