Fallos por Respuesta incorrecta
Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir.
Categorías
En la categoría Específico del dominio688 En la categoría Trucos anti-IA399 En la categoría Programación372 En la categoría Resolución de acertijos286 En la categoría Cultura general258 En la categoría Combinado99 En la categoría Inteligencia general95 En la categoría Seguimiento de instrucciones85 En la categoría Análisis y extracción de datos67 En la categoría Llamada de herramientas5
325/325
Filtrar modelos
Ningún modelo coincide con la búsqueda y los filtros actuales.
| Rango | Modelo | Empresa | Cantidad de Respuesta incorrecta | Puntuación | Costo total | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|---|
| #301 | Laguna S 2.1 none | Poolside | 18 | 4.5 | $0.022 | 2/22 | 11.7s |
| #297 | Mercury 2 none | Inception | 17 | 4.7 | $0.030 | 4/22 | 825ms |
| #253 | Kimi K2.5 none | Moonshot AI | 16 | 5.4 | $0.101 | 5/22 | 18.0s |
| #266 | Mistral Small 4 none | Mistral | 16 | 5.1 | $0.022 | 5/22 | 1.20s |
| #281 | Mercury 2.5 Preview none | Inception | 16 | 4.9 | $0.018 | 4/22 | 3.51s |
| #315 | Nemotron 3.5 Lightning none | NVIDIA | 16 | 4.0 | $0.007 | 3/22 | 1.21s |
| #256 | Inkling Small none | Thinkingmachines | 15 | 5.3 | $0.054 | 5/22 | 1.51s |
| #262 | Dots 3 Note Preview none | Dots Studio | 15 | 5.2 | $0.000 | 3/22 | 3.53s |
| #277 | Laguna S 2.1 low | Poolside | 15 | 5.0 | $0.082 | 3/22 | 85.3s |
| #279 | GPT-4o-mini none | OpenAI | 15 | 5.0 | $0.010 | 5/22 | 1.92s |
| #283 | Nemotron 3 Super none | NVIDIA | 15 | 4.8 | $0.008 | 5/22 | 6.04s |
| #287 | GPT-5.4 Nano none | OpenAI | 15 | 4.8 | $0.041 | 4/22 | 2.56s |
| #214 | Qwen3.5-Flash none | Qwen | 14 | 6.0 | $0.073 | 7/22 | 25.3s |
| #223 | GPT-5.4 none | OpenAI | 14 | 5.8 | $0.397 | 7/22 | 2.08s |
| #224 | Solar Pro 4 none | Upstage | 14 | 5.8 | $0.006 | 7/22 | 5.37s |