Fallos por Respuesta incorrecta
Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Costo total ↓.
Categorías
En la categoría Específico del dominio665 En la categoría Trucos anti-IA386 En la categoría Programación362 En la categoría Resolución de acertijos275 En la categoría Cultura general249 En la categoría Combinado95 En la categoría Inteligencia general91 En la categoría Seguimiento de instrucciones82 En la categoría Análisis y extracción de datos66 En la categoría Llamada de herramientas5
316/316
Filtrar modelos
Ningún modelo coincide con la búsqueda y los filtros actuales.
| Rango | Modelo | Empresa | Cantidad de Respuesta incorrecta | Puntuación | Costo total | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|---|
| #156 | Gemini 3 Flash Preview none | 8 | 6.8 | $0.085 | 13/22 | 2.82s | |
| #290 | Granite 4.2 8B high | IBM Granite | 6 | 4.6 | $0.084 | 4/22 | 235.9s |
| #269 | Laguna S 2.1 low | Poolside | 15 | 5.0 | $0.082 | 3/22 | 85.3s |
| #136 | DeepSeek V3.2 medium | DeepSeek | 5 | 7.0 | $0.078 | 11/22 | 68.4s |
| #228 | KAT-Coder-Air V2.5 high | Kwaipilot | 9 | 5.6 | $0.077 | 7/22 | 15.9s |
| #208 | Qwen3.5-Flash none | Qwen | 14 | 6.0 | $0.073 | 7/22 | 25.3s |
| #172 | Qwen3.5 Plus 2026-02-15 none | Qwen | 11 | 6.6 | $0.073 | 11/22 | 9.86s |
| #69 | DeepSeek V4 Flash 0731 low | DeepSeek | 7 | 8.0 | $0.072 | 13/22 | 77.6s |
| #111 | GPT-5.6 Luna medium | OpenAI | 9 | 7.4 | $0.072 | 13/22 | 7.43s |
| #77 | Qwen3.8 27B low | Qwen | 4 | 7.9 | ~$0.071 | 15/22 | 39.1s |
| #282 | KAT-Coder-Air V2.5 none | Kwaipilot | 13 | 4.8 | $0.070 | 5/22 | 12.5s |
| #286 | Grok 4.1 Fast medium | X AI | 4 | 4.7 | $0.069 | 9/19 | 23.8s |
| #245 | MiMo-V2.5-Pro none | Xiaomi | 12 | 5.4 | $0.068 | 5/22 | 4.24s |
| #174 | Laguna XS 2.1 medium | Poolside | 10 | 6.5 | $0.068 | 9/22 | 48.2s |
| #186 | Seed-2.0-Lite none | Bytedance Seed | 13 | 6.2 | $0.066 | 8/22 | 4.37s |