Programación: No siguió las instrucciones
Programación
No siguió las instrucciones
Mira qué modelos de IA tienen más probabilidades de caer en No siguió las instrucciones dentro de Programación, para detectar puntos débiles más rápido. Ordenar por: Costo total ↑.
Motivos de fallo
25/25
Filtrar modelos
Ningún modelo coincide con la búsqueda y los filtros actuales.
| Rango | Modelo | Empresa | Cantidad de No siguió las instrucciones | Puntuación de categoría | Costo total | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|---|
| #260 | Cobuddy medium | Baidu | 1 | 3.7 | $0.000 | 0/3 | 79.2s |
| #279 | Ling 3.0 Tiny high | Inclusionai | 1 | 2.9 | $0.000 | 0/3 | 177.7s |
| #280 | Ling 3.0 Tiny low | Inclusionai | 1 | 2.9 | $0.000 | 0/3 | 170.7s |
| #283 | Ling 3.0 Tiny medium | Inclusionai | 1 | 2.9 | $0.000 | 0/3 | 212.0s |
| #276 | Granite 4.1 8B none | IBM Granite | 1 | 4.5 | $0.007 | 0/3 | 775ms |
| #274 | MiMo-V2-Flash none | Xiaomi | 1 | 4.3 | $0.025 | 0/3 | 2.64s |
| #259 | Laguna M.1 medium | Poolside | 1 | 1.5 | $0.033 | 0/1 | 35.6s |
| #244 | DeepSeek V3.2 none | DeepSeek | 1 | 3.1 | $0.054 | 0/3 | 14.5s |
| #282 | Qwen3.5-9B medium | Qwen | 1 | 2.9 | $0.062 | 0/3 | 100.9s |
| #222 | MiMo-V2.5-Pro none | Xiaomi | 1 | 4.3 | $0.068 | 0/3 | 1.41s |
| #258 | Grok 4.1 Fast medium | X AI | 1 | 7.8 | $0.069 | 0/1 | 23.6s |
| #179 | Qwen3.5 Plus 2026-04-20 none | Qwen | 1 | 3.9 | $0.122 | 0/3 | 1.69s |
| #54 | DeepSeek V4 Flash 0731 high | DeepSeek | 1 | 6.3 | $0.134 | 1/3 | 252.7s |
| #138 | GLM 5.2 none | Z.ai | 1 | 3.7 | $0.153 | 0/3 | 7.55s |
| #203 | Kimi K2.6 none | Moonshot AI | 1 | 5.5 | $0.230 | 1/3 | 82.6s |