Fallos por Respuesta incorrecta
Mira qué modelos de IA se encuentran con Respuesta incorrecta con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Tiempo de respuesta (promedio) ↓.
Categorías
En la categoría Específico del dominio421 En la categoría Trucos anti-IA293 En la categoría Programación259 En la categoría Resolución de acertijos204 En la categoría Cultura general172 En la categoría Combinado69 En la categoría Inteligencia general62 En la categoría Seguimiento de instrucciones61 En la categoría Análisis y extracción de datos41 En la categoría Llamada de herramientas3
215/215
Filtrar modelos
Ningún modelo coincide con la búsqueda y los filtros actuales.
| Rango | Modelo | Empresa | Cantidad de Respuesta incorrecta | Puntuación | Costo total | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|---|
| #149 | Gemini 3.1 Flash Lite high | 4 | 5.6 | $2.044 | 10/18 | 62.0s | |
| #25 | Grok 4.5 medium | X AI | 6 | 8.3 | $1.928 | 16/22 | 61.7s |
| #94 | Qwen3.6 35B A3B medium | Qwen | 4 | 6.7 | $0.746 | 13/22 | 58.1s |
| #141 | Hy3 preview high | Tencent | 3 | 5.9 | $0.048 | 11/21 | 56.6s |
| #185 | Ring-2.6-1T none | Inclusionai | 5 | 4.8 | $0.026 | 9/22 | 55.1s |
| #134 | GPT-5 Nano medium | OpenAI | 9 | 6.1 | $0.114 | 9/22 | 54.9s |
| #52 | Grok Build 0.1 medium | X AI | 5 | 7.6 | $1.097 | 14/22 | 52.1s |
| #146 | Nemotron 3 Super medium | NVIDIA | 5 | 5.7 | $0.055 | 8/22 | 52.0s |
| #40 | Qwen3.7 Plus medium | Qwen | 5 | 7.9 | $0.267 | 15/22 | 51.5s |
| #49 | DeepSeek V4 Flash high | DeepSeek | 6 | 7.7 | $0.041 | 13/22 | 49.7s |
| #39 | Seed-2.0-Lite medium | Bytedance Seed | 5 | 7.9 | $0.234 | 14/22 | 48.5s |
| #108 | Laguna XS 2.1 medium | Poolside | 11 | 6.5 | $0.068 | 9/22 | 47.9s |
| #77 | Grok 4.3 medium | X AI | 5 | 7.1 | $0.779 | 13/22 | 47.4s |
| #78 | GLM 5.1 medium | Z.ai | 4 | 7.1 | $0.535 | 13/22 | 46.8s |
| #74 | Qwen3.5 Plus 2026-04-20 medium | Qwen | 8 | 7.2 | $0.317 | 13/22 | 46.4s |