Fallos por categoría de AI BENCHY
Análisis y extracción de datos: Respuesta incorrecta
Análisis y extracción de datos
Respuesta incorrecta
Mira qué modelos de IA tienen más probabilidades de caer en Respuesta incorrecta dentro de Análisis y extracción de datos, para detectar puntos débiles más rápido. Ordenar por: Pruebas correctas ↓.
Motivos de fallo
| Rango | Modelo | Empresa | Cantidad de Respuesta incorrecta | Puntuación de categoría | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|
| #27 | MiMo-V2.5-Pro medium | Xiaomi | 1 | 7.3 | 1/2 | 18.8s |
| #28 | MiMo-V2-Pro medium | Xiaomi | 1 | 7.3 | 1/2 | 17.2s |
| #65 | Mercury 2 medium | Inception | 1 | 7.3 | 1/2 | 1.11s |
| #75 | DeepSeek V3.2 none | DeepSeek | 1 | 6.3 | 1/2 | 9.42s |
| #79 | gpt-oss-120b medium | OpenAI | 1 | 6.4 | 1/2 | 1.98s |
| #86 | GLM 4.7 Flash none | Z.ai | 1 | 7.3 | 1/2 | 4.82s |
| #88 | Kimi K2.5 none | Moonshot AI | 1 | 7.3 | 1/2 | 42.1s |
| #90 | Ling 2.6 Flash none | Inclusionai | 1 | 6.5 | 1/2 | 8.48s |
| #94 | MiniMax M2.7 medium | Minimax | 1 | 6.3 | 1/2 | 21.9s |
| #95 | Elephant Alpha medium | Openrouter | 1 | 6.5 | 1/2 | 979ms |
| #99 | Elephant Alpha none | Openrouter | 1 | 6.5 | 1/2 | 1.04s |
| #101 | Qwen3 Coder Next none | Qwen | 1 | 6.5 | 1/2 | 1.32s |
| #106 | Mercury 2 none | Inception | 1 | 7.3 | 1/2 | 667ms |
| #107 | Qwen3 Coder Next medium | Qwen | 1 | 6.5 | 1/2 | 81.8s |
| #113 | GPT-5.4 Nano none | OpenAI | 1 | 6.5 | 1/2 | 1.11s |