Fallos AI BENCHY
Fallos por Respuesta incorrecta
Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir.
Categorías
En la categoría Específico del dominio182 En la categoría Trucos anti-IA165 En la categoría Resolución de acertijos85 En la categoría Seguimiento de instrucciones44 En la categoría Combinado37 En la categoría Programación28 En la categoría Análisis y extracción de datos19 En la categoría Inteligencia general10 En la categoría Llamada de herramientas2
| Rango | Modelo | Empresa | Cantidad de Respuesta incorrecta | Puntuación | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|
| #89 | GPT-4o-mini none | OpenAI | 13 | 4.9 | 4/18 | 2.00s |
| #91 | Mercury 2 none | Inception | 13 | 4.8 | 4/18 | 613ms |
| #95 | Grok 4.1 Fast none | X AI | 13 | 4.5 | 3/18 | 1.76s |
| #96 | GPT-5.4 Nano none | OpenAI | 13 | 4.5 | 2/18 | 1.40s |
| #76 | Kimi K2.5 none | Moonshot AI | 12 | 5.5 | 6/18 | 13.4s |
| #87 | Qwen3 Coder Next none | Qwen | 12 | 5.1 | 4/18 | 10.2s |
| #94 | MiMo-V2-Flash none | Xiaomi | 12 | 4.5 | 3/18 | 2.79s |
| #70 | Qwen3.5-122B-A10B none | Qwen | 11 | 5.7 | 6/18 | 3.69s |
| #78 | Trinity Large Preview none | Arcee AI | 11 | 5.3 | 5/18 | 5.07s |
| #83 | Mistral Small 4 none | Mistral | 11 | 5.2 | 5/18 | 665ms |
| #61 | Seed-2.0-Lite none | Bytedance Seed | 10 | 6.2 | 8/18 | 2.53s |
| #62 | Gemini 2.5 Flash none | 10 | 6.2 | 7/18 | 903ms | |
| #66 | GPT-5.4 none | OpenAI | 10 | 5.9 | 7/18 | 1.51s |
| #67 | Qwen3.5-27B none | Qwen | 10 | 5.9 | 6/18 | 1.74s |
| #74 | GLM 4.7 Flash none | Z.ai | 10 | 5.6 | 5/18 | 3.35s |