Fallos por No siguió las instrucciones
Mira qué modelos de IA se encuentran con No siguió las instrucciones con más frecuencia para detectar riesgos de fiabilidad antes de elegir. Ordenar por: Pruebas correctas ↓.
Categorías
En la categoría Resolución de acertijos128 En la categoría Inteligencia general115 En la categoría Seguimiento de instrucciones48 En la categoría Trucos anti-IA44 En la categoría Programación29 En la categoría Llamada de herramientas12 En la categoría Análisis y extracción de datos7 En la categoría Específico del dominio2 En la categoría Combinado1
215/215
Filtrar modelos
Ningún modelo coincide con la búsqueda y los filtros actuales.
| Rango | Modelo | Empresa | Cantidad de No siguió las instrucciones | Puntuación | Costo total | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|---|
| #253 | Granite 4.2 8B low | IBM Granite | 1 | 5.1 | $0.012 | 7/22 | 54.4s |
| #307 | gpt-oss-120b none | OpenAI | 2 | 3.7 | $0.010 | 6/19 | 21.6s |
| #257 | GLM 5 Turbo none | Z.ai | 2 | 5.1 | $0.047 | 6/21 | 2.82s |
| #290 | Elephant Alpha medium | Openrouter | 2 | 4.3 | $0.000 | 6/21 | 1.27s |
| #201 | Qwen3.5-35B-A3B none | Qwen | 2 | 5.9 | $0.142 | 6/22 | 12.7s |
| #207 | GPT-5.4 Mini none | OpenAI | 3 | 5.9 | $0.095 | 6/22 | 1.58s |
| #215 | Ling-3.0-flash none | Inclusionai | 1 | 5.7 | $0.004 | 6/22 | 3.56s |
| #217 | Kimi K2.6 none | Moonshot AI | 3 | 5.7 | $0.233 | 6/22 | 19.6s |
| #218 | Qwen3.5-122B-A10B none | Qwen | 2 | 5.7 | $0.283 | 6/22 | 12.9s |
| #243 | Seed-2.0-Code none | Bytedance Seed | 2 | 5.3 | $0.151 | 6/22 | 14.7s |
| #248 | Inkling none | Thinkingmachines | 1 | 5.2 | $0.147 | 6/22 | 3.47s |
| #260 | Mercury 2.5 Preview low | Inception | 2 | 5.0 | $0.011 | 6/22 | 1.31s |
| #262 | DeepSeek V3.2 none | DeepSeek | 1 | 5.0 | $0.054 | 6/22 | 17.9s |
| #266 | Ling-2.6-flash none | Inclusionai | 2 | 4.9 | $0.002 | 6/22 | 10.7s |
| #306 | Laguna Xs.2 none | Poolside | 1 | 3.8 | $0.004 | 5/19 | 806ms |