Programación: No siguió las instrucciones
Programación
No siguió las instrucciones
Mira qué modelos de IA tienen más probabilidades de caer en No siguió las instrucciones dentro de Programación, para detectar puntos débiles más rápido. Ordenar por: Costo total ↓.
Motivos de fallo
25/25
Filtrar modelos
Ningún modelo coincide con la búsqueda y los filtros actuales.
| Rango | Modelo | Empresa | Cantidad de No siguió las instrucciones | Puntuación de categoría | Costo total | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|---|
| #74 | Claude Opus 4.6 medium | Anthropic | 1 | 5.7 | $2.961 | 1/3 | 30.1s |
| #95 | Qwen3.8 2.4T A95B high | Qwen | 1 | 5.9 | $2.357 | 1/3 | 160.5s |
| #126 | Seed-2.0-Code high | Bytedance Seed | 1 | 6.2 | $1.273 | 1/3 | 266.7s |
| #104 | Claude Opus 4.8 none | Anthropic | 1 | 5.5 | $1.166 | 1/3 | 3.29s |
| #176 | Trinity Large Thinking medium | Arcee AI | 1 | 7.5 | $0.798 | 2/3 | 179.0s |
| #18 | Gemini 3.5 Flash medium | 1 | 7.9 | $0.665 | 2/3 | 12.6s | |
| #252 | Trinity Large Thinking high | Arcee AI | 1 | 3.7 | $0.624 | 0/3 | 245.0s |
| #133 | DeepSeek V4 Pro none | DeepSeek | 1 | 5.6 | $0.351 | 1/3 | 13.4s |
| #141 | Gemini 3.5 Flash minimal | 1 | 5.6 | $0.300 | 1/3 | 2.75s | |
| #42 | Qwen3.8 27B high | Qwen | 1 | 8.1 | ~$0.287 | 2/3 | 248.6s |
| #203 | Kimi K2.6 none | Moonshot AI | 1 | 5.5 | $0.230 | 1/3 | 82.6s |
| #138 | GLM 5.2 none | Z.ai | 1 | 3.7 | $0.153 | 0/3 | 7.55s |
| #54 | DeepSeek V4 Flash 0731 high | DeepSeek | 1 | 6.3 | $0.134 | 1/3 | 252.7s |
| #179 | Qwen3.5 Plus 2026-04-20 none | Qwen | 1 | 3.9 | $0.122 | 0/3 | 1.69s |
| #258 | Grok 4.1 Fast medium | X AI | 1 | 7.8 | $0.069 | 0/1 | 23.6s |