Fallos AI BENCHY
Fallos por Error de API
Mira qué modelos de IA se encuentran con Error de API con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Tiempo de respuesta (promedio) ↓.
Categorías
En la categoría Programación43 En la categoría Análisis y extracción de datos16 En la categoría Llamada de herramientas15 En la categoría Combinado13 En la categoría Resolución de acertijos13 En la categoría Trucos anti-IA13 En la categoría Cultura general12 En la categoría Inteligencia general12 En la categoría Específico del dominio6 En la categoría Seguimiento de instrucciones1
| Rango | Modelo | Empresa | Cantidad de Error de API | Puntuación | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|
| #161 | Qwen3.5-9B medium | Qwen | 1 | 4.2 | 3/21 | 82.2s |
| #25 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 1 | 7.9 | 14/21 | 73.8s |
| #66 | Qwen3.5-35B-A3B medium | Qwen | 1 | 7.1 | 11/21 | 72.6s |
| #72 | DeepSeek V3.2 medium | DeepSeek | 2 | 7.0 | 11/21 | 68.7s |
| #103 | DeepSeek V4 Pro high | DeepSeek | 5 | 6.0 | 8/21 | 65.2s |
| #49 | Qwen3.5-Flash medium | Qwen | 1 | 7.4 | 12/21 | 63.3s |
| #75 | Ring-2.6-1T medium | Inclusionai | 2 | 6.9 | 11/21 | 61.3s |
| #82 | Hy3 preview high | Tencent | 7 | 6.6 | 11/21 | 56.6s |
| #27 | Gemma 4 31B medium | 2 | 7.8 | 14/21 | 56.5s | |
| #96 | Ring-2.6-1T none | Inclusionai | 5 | 6.2 | 9/21 | 55.1s |
| #80 | Mimo V2 Omni medium | Xiaomi | 1 | 6.7 | 10/21 | 41.2s |
| #119 | Cobuddy medium | Baidu | 1 | 5.6 | 7/21 | 39.9s |
| #83 | Step 3.5 Flash none | Stepfun | 4 | 6.6 | 6/12 | 39.0s |
| #130 | MiniMax M2.7 medium | Minimax | 1 | 5.3 | 5/21 | 38.2s |
| #55 | GLM 5.1 medium | Z.ai | 1 | 7.3 | 12/21 | 33.7s |