Fallos AI BENCHY
Fallos por Respuesta incorrecta
Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir.
Categorías
En la categoría Específico del dominio314 En la categoría Trucos anti-IA245 En la categoría Programación194 En la categoría Resolución de acertijos147 En la categoría Cultura general130 En la categoría Seguimiento de instrucciones53 En la categoría Combinado52 En la categoría Análisis y extracción de datos35 En la categoría Inteligencia general32 En la categoría Llamada de herramientas2
| Rango | Modelo | Empresa | Cantidad de Respuesta incorrecta | Puntuación | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|
| #69 | Claude Opus 4.6 medium | Anthropic | 3 | 7.0 | 12/21 | 25.9s |
| #82 | Hy3 preview high | Tencent | 3 | 6.6 | 11/21 | 56.6s |
| #3 | Gemini 3.5 Flash low | 2 | 9.4 | 19/21 | 3.27s | |
| #4 | Gemini 3.1 Pro Preview medium | 2 | 9.4 | 19/21 | 20.1s | |
| #7 | Gemini 3.5 Flash medium | 2 | 9.0 | 18/21 | 4.94s | |
| #12 | Gemini 3.1 Flash Lite Preview high | 2 | 8.6 | 13/16 | 68.1s | |
| #27 | Gemma 4 31B medium | 2 | 7.8 | 14/21 | 56.5s | |
| #66 | Qwen3.5-35B-A3B medium | Qwen | 2 | 7.1 | 11/21 | 72.6s |
| #93 | Qwen3.6 Plus Preview medium | Qwen | 2 | 6.3 | 9/19 | 15.2s |
| #161 | Qwen3.5-9B medium | Qwen | 2 | 4.2 | 3/21 | 82.2s |
| #1 | Gemini 3 Flash Preview medium | 1 | 9.8 | 20/21 | 18.6s | |
| #2 | Gemini 3.5 Flash high | 1 | 9.6 | 20/21 | 8.84s | |
| #83 | Step 3.5 Flash none | Stepfun | 1 | 6.6 | 6/12 | 39.0s |