Programación: No siguió las instrucciones
Programación
No siguió las instrucciones
Mira qué modelos de IA tienen más probabilidades de caer en No siguió las instrucciones dentro de Programación, para detectar puntos débiles más rápido. Ordenar por: Pruebas correctas ↑.
Motivos de fallo
38/38
Filtrar modelos
Ningún modelo coincide con la búsqueda y los filtros actuales.
| Rango | Modelo | Empresa | Cantidad de No siguió las instrucciones | Puntuación de categoría | Costo total | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|---|
| #130 | Mistral Large 4 high | Mistral | 1 | 0.3 | $1.391 | 0/3 | 1277.8s |
| #177 | Claude Sonnet 5.5 low | Anthropic | 2 | 0.3 | $0.909 | 0/3 | 5.81s |
| #198 | GLM 5.2 none | Z.ai | 1 | 0.4 | $0.250 | 0/3 | 7.55s |
| #204 | Claude Sonnet 5.5 medium | Anthropic | 2 | 0.3 | $1.100 | 0/3 | 6.07s |
| #243 | Claude Fable 5.1 low | Anthropic | 2 | 0.3 | $3.395 | 0/3 | 6.75s |
| #248 | Qwen3.5 Plus 2026-04-20 none | Qwen | 1 | 0.4 | $0.216 | 0/3 | 1.69s |
| #269 | Trinity Large Thinking high | Arcee AI | 1 | 0.4 | $0.794 | 0/3 | 245.0s |
| #283 | Ling 3.1 Flash none | Inclusionai | 1 | 0.5 | $0.000 | 0/3 | 31.9s |
| #293 | MiMo-V2.6-Flash none | Xiaomi | 1 | 0.4 | $0.060 | 0/3 | 744ms |
| #313 | MiMo-V2.5-Pro none | Xiaomi | 1 | 0.4 | $0.135 | 0/3 | 1.41s |
| #329 | Hy4 preview none | Tencent | 1 | 0.4 | $0.165 | 0/3 | 45.5s |
| #339 | DeepSeek V3.2 none | DeepSeek | 1 | 0.3 | $0.119 | 0/3 | 14.5s |
| #356 | Cobuddy medium | Baidu | 1 | 0.4 | $0.000 | 0/3 | 79.2s |
| #363 | Mercury 2.5 none | Inception | 1 | 0.4 | $0.026 | 0/3 | 12.5s |
| #365 | Qwen3.5-9B medium | Qwen | 1 | 0.3 | $0.106 | 0/3 | 100.9s |