Qwen3.8 27B (low) lidera en puntuación media con 7.9 vs 7.8. No se midió el coste del hardware local, por lo que no hay comparaciones de coste disponibles. Qwen3.8 27B (low) es más rápido con 39.11s vs 45.52s, con tasas de acierto de 71.2% vs 68.2%.
Benchmarks generados a partir de los suites de prueba de AI BENCHY en:
2026-08-15
Rango
#63
Total de tokens de salida
197,632
Tiempo de respuesta (promedio)
45.52s
Costo total
$0.418
Rango
#61
Total de tokens de salida
169,329
Tiempo de respuesta (promedio)
39.11s
Costo total
N/D
Modelo recomendadoQwen3.6 Plus (medium)
Tiene el mejor equilibrio general entre puntuación, fiabilidad, coste y tiempo de respuesta en esta comparación.
Qwen3.8 27BQwen3.8 27BlowLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.Lanzamiento: 2026-08-14
Qwen3.8 27BQwen3.8 27BlowLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.Lanzamiento: 2026-08-14
Puntuación
7.8Puntaje promedio en todas las pruebas de benchmark.…
7.9Puntaje promedio en todas las pruebas de benchmark.…
Rango
#63
#61
Fiabilidad
10.0Puntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
10.0Puntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
Consistencia
9.3La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
Intentos
66/66
66/66
Pruebas correctas
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 5Error de API: 1No siguió las instrucciones: 1Tiempo de respuesta (promedio)45.52sTiempo de respuesta (máximo)291.55sTiempo de respuesta (total)955.94sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 4Sin respuesta: 2No siguió las instrucciones: 1Tiempo de respuesta (promedio)39.11sTiempo de respuesta (máximo)376.04sTiempo de respuesta (total)860.51sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
Tasa de aciertos por intento
71.2%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
68.2%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
Pruebas inestables
2Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Ejecuciones totales
66Ejecuciones totales…
66Ejecuciones totales…
Costo por resultado
1.695Muestra el costo promedio por respuesta correcta del benchmark en centavos (menor es mejor).…
N/DMuestra el costo promedio por respuesta correcta del benchmark en centavos (menor es mejor).…
Costo total
$0.418Costo total (precio actual)…
N/DCosto total (precio actual)…
Precio de entrada
$0.325 / 1MPrecio de entrada…
N/DPrecio de entrada…
Precio de salida
$1.950 / 1MPrecio de salida…
N/DPrecio de salida…
Total de tokens de entrada
97,698Total de tokens de entrada…
99,705Total de tokens de entrada…
Tokens de salida
6,417Tokens de salida…
1,545Tokens de salida…
Tokens de razonamiento
191,215Tokens de razonamiento…
167,784Tokens de razonamiento…
Tiempo de respuesta (promedio)
45.52sTiempo de respuesta (promedio)…
39.11sTiempo de respuesta (promedio)…
Tiempo de respuesta (máximo)
291.55sTiempo de respuesta (máximo)…
376.04sTiempo de respuesta (máximo)…
Tiempo de respuesta (total)
955.94sTiempo de respuesta (total)…
860.51sTiempo de respuesta (total)…
Parámetros
~397B en total (~17B activos)
27.3B
Disponibilidad
Código cerrado
Pesos disponibles
Generación showcase de modelos
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#63 Qwen3.6 Plus
medium
Coste
$0.024
Tiempo
219.0s
Tokens
12,235 tok
#61 Qwen3.8 27B
lowLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)9.90sTiempo de respuesta (máximo)19.37sTiempo de respuesta (total)39.60sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
9.90sTiempo de respuesta (promedio)…
672Total de tokens de entrada…
207Tokens de salida…
7,557Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.02sTiempo de respuesta (máximo)5.68sTiempo de respuesta (total)12.07sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
6.1Puntaje promedio en todas las pruebas de benchmark.…
7.8La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
44.4%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Error de API: 1Respuesta incorrecta: 1Tiempo de respuesta (promedio)153.12sTiempo de respuesta (máximo)201.68sTiempo de respuesta (total)306.23sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
153.12sTiempo de respuesta (promedio)…
7,098Total de tokens de entrada…
58Tokens de salida…
50,586Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
7.7Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Sin respuesta: 1Tiempo de respuesta (promedio)140.92sTiempo de respuesta (máximo)376.04sTiempo de respuesta (total)422.75sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)163.25sTiempo de respuesta (máximo)291.55sTiempo de respuesta (total)326.50sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
163.25sTiempo de respuesta (promedio)…
71,058Total de tokens de entrada…
5,011Tokens de salida…
55,925Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)90.63sTiempo de respuesta (máximo)143.71sTiempo de respuesta (total)181.27sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)14.95sTiempo de respuesta (máximo)15.40sTiempo de respuesta (total)29.90sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
14.95sTiempo de respuesta (promedio)…
7,782Total de tokens de entrada…
270Tokens de salida…
10,706Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)8.03sTiempo de respuesta (máximo)9.09sTiempo de respuesta (total)16.06sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
2.9Puntaje promedio en todas las pruebas de benchmark.…
7.2La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
11.1%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)46.39sTiempo de respuesta (máximo)79.81sTiempo de respuesta (total)139.18sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
46.39sTiempo de respuesta (promedio)…
780Total de tokens de entrada…
61Tokens de salida…
39,854Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
5.3Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)60.78sTiempo de respuesta (máximo)120.94sTiempo de respuesta (total)182.34sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
5.1Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)27.05sTiempo de respuesta (máximo)27.05sTiempo de respuesta (total)27.05sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
27.05sTiempo de respuesta (promedio)…
516Total de tokens de entrada…
111Tokens de salida…
5,232Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
5.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)5.37sTiempo de respuesta (máximo)5.37sTiempo de respuesta (total)5.37sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)7.54sTiempo de respuesta (máximo)11.67sTiempo de respuesta (total)15.07sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
7.54sTiempo de respuesta (promedio)…
699Total de tokens de entrada…
102Tokens de salida…
5,552Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.43sTiempo de respuesta (máximo)2.87sTiempo de respuesta (total)4.86sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)6.34sTiempo de respuesta (máximo)7.52sTiempo de respuesta (total)19.03sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
6.34sTiempo de respuesta (promedio)…
696Total de tokens de entrada…
309Tokens de salida…
6,712Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
7.7Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)4.91sTiempo de respuesta (máximo)8.81sTiempo de respuesta (total)14.74sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)5.87sTiempo de respuesta (máximo)5.87sTiempo de respuesta (total)5.87sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
5.87sTiempo de respuesta (promedio)…
8,193Total de tokens de entrada…
267Tokens de salida…
1,330Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)8.42sTiempo de respuesta (máximo)8.42sTiempo de respuesta (total)8.42sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)47.51sTiempo de respuesta (máximo)47.51sTiempo de respuesta (total)47.51sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
47.51sTiempo de respuesta (promedio)…
204Total de tokens de entrada…
21Tokens de salida…
7,761Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Sin respuesta: 1Tiempo de respuesta (promedio)12.64sTiempo de respuesta (máximo)12.64sTiempo de respuesta (total)12.64sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…