Fallos AI BENCHY
Fallos por Error de API
Mira qué modelos de IA se encuentran con Error de API con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Tiempo de respuesta (promedio) ↓.
Categorías
En la categoría Programación43 En la categoría Análisis y extracción de datos16 En la categoría Llamada de herramientas15 En la categoría Combinado13 En la categoría Resolución de acertijos13 En la categoría Trucos anti-IA13 En la categoría Cultura general12 En la categoría Inteligencia general12 En la categoría Específico del dominio6 En la categoría Seguimiento de instrucciones1
| Rango | Modelo | Empresa | Cantidad de Error de API | Puntuación | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|
| #156 | Hy3 preview none | Tencent | 4 | 4.4 | 4/21 | 12.9s |
| #113 | DeepSeek V4 Pro none | DeepSeek | 1 | 5.7 | 7/21 | 12.4s |
| #111 | Owl Alpha medium | Openrouter | 1 | 5.7 | 8/21 | 11.9s |
| #79 | Hunter Alpha medium | OpenRouter | 1 | 6.7 | 8/18 | 10.3s |
| #20 | Gemini 3.5 Flash none | 3 | 8.1 | 15/21 | 9.93s | |
| #84 | Grok 4.20 Multi Agent Beta medium | X AI | 2 | 6.6 | 8/18 | 9.69s |
| #132 | Mistral Small 4 medium | Mistral | 2 | 5.3 | 5/21 | 9.40s |
| #138 | Ling-2.6-flash none | Inclusionai | 2 | 5.0 | 6/21 | 9.34s |
| #35 | Gemini 3 PRO Preview medium | 4 | 7.6 | 14/21 | 9.05s | |
| #159 | Ling-2.6-1T none | Inclusionai | 3 | 4.3 | 3/21 | 7.72s |
| #107 | Laguna Xs.2 medium | Poolside | 4 | 5.8 | 6/19 | 6.73s |
| #116 | Hunter Alpha none | OpenRouter | 1 | 5.7 | 6/18 | 4.70s |
| #85 | Gemma 4 31B none | 2 | 6.5 | 10/21 | 4.05s | |
| #153 | Qwen3.6 35B A3B none | Qwen | 2 | 4.6 | 4/21 | 3.73s |
| #151 | Trinity Large Preview none | Arcee AI | 2 | 4.6 | 4/21 | 2.98s |