Qwen3.8 27B (medium) lidera en puntuación media con 7.8 vs 7.7. No se midió el coste del hardware local, por lo que no hay comparaciones de coste disponibles. Qwen3.8 27B (medium) es más rápido con 33.05s vs 92.50s, con tasas de acierto de 63.6% vs 66.7%.
Benchmarks generados a partir de los suites de prueba de AI BENCHY en:
2026-08-15
Rango
#75
Total de tokens de salida
209,444
Tiempo de respuesta (promedio)
92.50s
Costo total
$0.555
Rango
#68
Total de tokens de salida
136,162
Tiempo de respuesta (promedio)
33.05s
Costo total
N/D
Modelo recomendadoDeepSeek V4 Pro (high)
Tiene el mejor equilibrio general entre puntuación, fiabilidad, coste y tiempo de respuesta en esta comparación.
Qwen3.8 27BQwen3.8 27BmediumLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.Lanzamiento: 2026-08-14
Qwen3.8 27BQwen3.8 27BmediumLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.Lanzamiento: 2026-08-14
Puntuación
7.7Puntaje promedio en todas las pruebas de benchmark.…
7.8Puntaje promedio en todas las pruebas de benchmark.…
Rango
#75
#68
Fiabilidad
10.0Puntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
9.6Puntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
Consistencia
7.7La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
9.7La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
5.7Puntaje promedio en todas las pruebas de benchmark.…
5.9La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
58.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
2Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Sin respuesta: 1Tiempo de respuesta (promedio)25.70sTiempo de respuesta (máximo)48.19sTiempo de respuesta (total)102.80sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
25.70sTiempo de respuesta (promedio)…
536Total de tokens de entrada…
149Tokens de salida…
3,214Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.93sTiempo de respuesta (máximo)5.18sTiempo de respuesta (total)11.70sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
6.3Puntaje promedio en todas las pruebas de benchmark.…
8.7La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Error de API: 1Tiempo agotado: 1Tiempo de respuesta (promedio)243.00sTiempo de respuesta (máximo)416.76sTiempo de respuesta (total)729.00sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
243.00sTiempo de respuesta (promedio)…
5,090Total de tokens de entrada…
383Tokens de salida…
84,580Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)40.50sTiempo de respuesta (máximo)72.14sTiempo de respuesta (total)121.51sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)78.99sTiempo de respuesta (máximo)119.80sTiempo de respuesta (total)157.97sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
78.99sTiempo de respuesta (promedio)…
66,082Total de tokens de entrada…
4,582Tokens de salida…
25,404Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
8.7Puntaje promedio en todas las pruebas de benchmark.…
6.9La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
83.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Llamada de herramienta no válida: 1Tiempo de respuesta (promedio)124.48sTiempo de respuesta (máximo)214.63sTiempo de respuesta (total)248.96sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)25.03sTiempo de respuesta (máximo)27.49sTiempo de respuesta (total)50.06sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
25.03sTiempo de respuesta (promedio)…
7,690Total de tokens de entrada…
274Tokens de salida…
2,166Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
6.5Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
50.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)8.76sTiempo de respuesta (máximo)10.36sTiempo de respuesta (total)17.53sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.6Puntaje promedio en todas las pruebas de benchmark.…
7.2La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
22.2%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)249.47sTiempo de respuesta (máximo)387.23sTiempo de respuesta (total)748.42sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
249.47sTiempo de respuesta (promedio)…
578Total de tokens de entrada…
16,870Tokens de salida…
58,188Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
5.3Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)76.98sTiempo de respuesta (máximo)144.07sTiempo de respuesta (total)230.93sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)8.83sTiempo de respuesta (máximo)8.83sTiempo de respuesta (total)8.83sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
8.83sTiempo de respuesta (promedio)…
471Total de tokens de entrada…
115Tokens de salida…
1,013Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
5.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)9.20sTiempo de respuesta (máximo)9.20sTiempo de respuesta (total)9.20sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
7.8Puntaje promedio en todas las pruebas de benchmark.…
6.6La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
83.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)8.73sTiempo de respuesta (máximo)9.53sTiempo de respuesta (total)17.45sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
8.73sTiempo de respuesta (promedio)…
627Total de tokens de entrada…
66Tokens de salida…
2,726Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.54sTiempo de respuesta (máximo)2.67sTiempo de respuesta (total)5.07sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
6.9Puntaje promedio en todas las pruebas de benchmark.…
4.9La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
77.8%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
2Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Respuesta incorrecta: 1Tiempo de respuesta (promedio)56.85sTiempo de respuesta (máximo)146.68sTiempo de respuesta (total)170.55sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
56.85sTiempo de respuesta (promedio)…
591Total de tokens de entrada…
178Tokens de salida…
2,563Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
8.3Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)12.62sTiempo de respuesta (máximo)29.62sTiempo de respuesta (total)37.85sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
9.8Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)15.92sTiempo de respuesta (máximo)15.92sTiempo de respuesta (total)15.92sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
15.92sTiempo de respuesta (promedio)…
8,909Total de tokens de entrada…
295Tokens de salida…
701Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Error de API: 1Tiempo de respuesta (promedio)0msTiempo de respuesta (máximo)0msTiempo de respuesta (total)0msUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)34.01sTiempo de respuesta (máximo)34.01sTiempo de respuesta (total)34.01sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
34.01sTiempo de respuesta (promedio)…
183Total de tokens de entrada…
16Tokens de salida…
5,961Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Sin respuesta: 1Tiempo de respuesta (promedio)11.29sTiempo de respuesta (máximo)11.29sTiempo de respuesta (total)11.29sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…