Programación: No siguió las instrucciones
Programación
No siguió las instrucciones
Mira qué modelos de IA tienen más probabilidades de caer en No siguió las instrucciones dentro de Programación, para detectar puntos débiles más rápido. Ordenar por: Tiempo de respuesta (promedio) ↓.
Motivos de fallo
25/25
Filtrar modelos
Ningún modelo coincide con la búsqueda y los filtros actuales.
| Rango | Modelo | Empresa | Cantidad de No siguió las instrucciones | Puntuación de categoría | Costo total | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|---|
| #126 | Seed-2.0-Code high | Bytedance Seed | 1 | 6.2 | $1.273 | 1/3 | 266.7s |
| #54 | DeepSeek V4 Flash 0731 high | DeepSeek | 1 | 6.3 | $0.134 | 1/3 | 252.7s |
| #42 | Qwen3.8 27B high | Qwen | 1 | 8.1 | ~$0.287 | 2/3 | 248.6s |
| #252 | Trinity Large Thinking high | Arcee AI | 1 | 3.7 | $0.624 | 0/3 | 245.0s |
| #283 | Ling 3.0 Tiny medium | Inclusionai | 1 | 2.9 | $0.000 | 0/3 | 212.0s |
| #176 | Trinity Large Thinking medium | Arcee AI | 1 | 7.5 | $0.798 | 2/3 | 179.0s |
| #279 | Ling 3.0 Tiny high | Inclusionai | 1 | 2.9 | $0.000 | 0/3 | 177.7s |
| #280 | Ling 3.0 Tiny low | Inclusionai | 1 | 2.9 | $0.000 | 0/3 | 170.7s |
| #95 | Qwen3.8 2.4T A95B high | Qwen | 1 | 5.9 | $2.357 | 1/3 | 160.5s |
| #282 | Qwen3.5-9B medium | Qwen | 1 | 2.9 | $0.062 | 0/3 | 100.9s |
| #203 | Kimi K2.6 none | Moonshot AI | 1 | 5.5 | $0.230 | 1/3 | 82.6s |
| #260 | Cobuddy medium | Baidu | 1 | 3.7 | $0.000 | 0/3 | 79.2s |
| #259 | Laguna M.1 medium | Poolside | 1 | 1.5 | $0.033 | 0/1 | 35.6s |
| #74 | Claude Opus 4.6 medium | Anthropic | 1 | 5.7 | $2.961 | 1/3 | 30.1s |
| #258 | Grok 4.1 Fast medium | X AI | 1 | 7.8 | $0.069 | 0/1 | 23.6s |