Seguimiento de instrucciones: Respuesta incorrecta
Seguimiento de instrucciones
Respuesta incorrecta
Mira qué modelos de IA tienen más probabilidades de caer en Respuesta incorrecta dentro de Seguimiento de instrucciones, para detectar puntos débiles más rápido. Ordenar por: Tiempo de respuesta (promedio) ↓.
Motivos de fallo
61/61
Filtrar modelos
Ningún modelo coincide con la búsqueda y los filtros actuales.
| Rango | Modelo | Empresa | Cantidad de Respuesta incorrecta | Puntuación de categoría | Costo total | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|---|
| #171 | North Mini Code none | Cohere | 1 | 6.5 | $0.000 | 1/2 | 30.7s |
| #172 | MiniMax M2.7 medium | Minimax | 1 | 3.8 | $0.163 | 0/2 | 12.8s |
| #146 | Owl Alpha medium | Openrouter | 1 | 6.5 | $0.000 | 1/2 | 10.2s |
| #125 | Qwen3.5-Flash none | Qwen | 1 | 6.3 | $0.073 | 1/2 | 8.81s |
| #166 | Qwen3 Coder Next none | Qwen | 1 | 6.3 | $0.025 | 1/2 | 7.78s |
| #187 | Qwen3 Coder Next medium | Qwen | 1 | 6.3 | $0.032 | 1/2 | 7.49s |
| #74 | GLM 5.1 medium | Z.ai | 1 | 6.4 | $0.535 | 1/2 | 7.47s |
| #60 | LongCat 2.0 medium | Meituan | 1 | 6.5 | $0.478 | 1/2 | 7.38s |
| #97 | LongCat 2.0 high | Meituan | 1 | 6.5 | $0.469 | 1/2 | 6.96s |
| #91 | LongCat 2.0 low | Meituan | 1 | 6.5 | $0.391 | 1/2 | 6.39s |
| #162 | Ling-2.6-1T none | Inclusionai | 1 | 6.4 | $0.016 | 1/2 | 5.36s |
| #157 | Mimo V2 Omni none | Xiaomi | 1 | 6.5 | $0.021 | 1/2 | 4.26s |
| #82 | DeepSeek V4 Pro none | DeepSeek | 1 | 6.3 | $0.096 | 1/2 | 4.12s |
| #194 | GLM 4.7 Flash medium | Z.ai | 1 | 6.2 | $0.166 | 1/2 | 2.97s |
| #115 | Gemma 4 31B none | 1 | 6.5 | $0.035 | 1/2 | 2.84s |