Programación: Respuesta incorrecta
Programación
Respuesta incorrecta
Mira qué modelos de IA tienen más probabilidades de caer en Respuesta incorrecta dentro de Programación, para detectar puntos débiles más rápido.
Motivos de fallo
197/197
Filtrar modelos
Ningún modelo coincide con la búsqueda y los filtros actuales.
| Rango | Modelo | Empresa | Cantidad de Respuesta incorrecta | Puntuación de categoría | Costo total | Pruebas correctas | Tiempo de respuesta (promedio) |
|---|---|---|---|---|---|---|---|
| #207 | GLM 5V Turbo none | Z.ai | 2 | 5.5 | $0.052 | 1/3 | 3.13s |
| #209 | Gemma 4 26B A4B none | 2 | 3.7 | $0.015 | 0/3 | 4.16s | |
| #212 | KAT-Coder-Air V2.5 medium | Kwaipilot | 2 | 3.6 | $0.048 | 0/3 | 23.4s |
| #213 | Nemotron 3.5 Lightning high | NVIDIA | 2 | 4.4 | $0.134 | 0/3 | 168.4s |
| #214 | Qwen3.6 27B none | Qwen | 2 | 5.5 | $0.116 | 1/3 | 4.16s |
| #216 | Qwen3.8 27B none | Qwen | 2 | 5.5 | ~$0.006 | 1/3 | 1.19s |
| #222 | MiMo-V2.5-Pro none | Xiaomi | 2 | 4.3 | $0.068 | 0/3 | 1.41s |
| #223 | Kimi K2.5 none | Moonshot AI | 2 | 5.5 | $0.101 | 1/3 | 24.6s |
| #231 | Qwen3.6 35B A3B none | Qwen | 2 | 5.5 | $0.060 | 1/3 | 8.77s |
| #232 | Dots 3 Note Preview none | Dots Studio | 2 | 4.6 | $0.000 | 0/3 | 6.12s |
| #238 | MiMo-V2.5 none | Xiaomi | 2 | 5.5 | $0.025 | 1/3 | 3.24s |
| #244 | DeepSeek V3.2 none | DeepSeek | 2 | 3.1 | $0.054 | 0/3 | 14.5s |
| #262 | Qwen3 Coder Next medium | Qwen | 2 | 3.7 | $0.034 | 0/3 | 924ms |
| #274 | MiMo-V2-Flash none | Xiaomi | 2 | 4.3 | $0.025 | 0/3 | 2.64s |
| #5 | Gemini 3 Flash Preview medium | 1 | 8.6 | $0.763 | 2/3 | 84.4s |