La puntuación media está prácticamente empatada en 7.8 vs 7.8. No se midió el coste del hardware local, por lo que no hay comparaciones de coste disponibles. Qwen3.8 27B (medium) es más rápido con 33.05s vs 47.94s, con tasas de acierto de 69.7% vs 66.7%.
Benchmarks generados a partir de los suites de prueba de AI BENCHY en:
2026-08-15
Rango
#69
Total de tokens de salida
101,296
Tiempo de respuesta (promedio)
47.94s
Costo total
$0.236
Rango
#68
Total de tokens de salida
136,162
Tiempo de respuesta (promedio)
33.05s
Costo total
N/D
Modelo recomendadoSeed-2.0-Lite (medium)
Tiene la puntuación más alta en esta comparación (7.8) y el mejor equilibrio general entre coste y tiempo de respuesta en los 2 modelos.
Qwen3.8 27BQwen3.8 27BmediumLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.Lanzamiento: 2026-08-14
Qwen3.8 27BQwen3.8 27BmediumLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.Lanzamiento: 2026-08-14
Puntuación
7.8Puntaje promedio en todas las pruebas de benchmark.…
7.8Puntaje promedio en todas las pruebas de benchmark.…
Rango
#69
#68
Fiabilidad
10.0Puntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
9.6Puntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
Consistencia
8.6La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
9.7La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
Intentos
66/66
66/66
Pruebas correctas
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 6No siguió las instrucciones: 2Sin respuesta: 1Tiempo de respuesta (promedio)47.94sTiempo de respuesta (máximo)254.92sTiempo de respuesta (total)1054.57sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
8.3Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
75.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)17.99sTiempo de respuesta (máximo)48.33sTiempo de respuesta (total)71.98sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
17.99sTiempo de respuesta (promedio)…
942Total de tokens de entrada…
996Tokens de salida…
7,142Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.93sTiempo de respuesta (máximo)5.18sTiempo de respuesta (total)11.70sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
8.0Puntaje promedio en todas las pruebas de benchmark.…
9.8La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)156.74sTiempo de respuesta (máximo)254.92sTiempo de respuesta (total)470.22sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
156.74sTiempo de respuesta (promedio)…
8,247Total de tokens de entrada…
458Tokens de salida…
31,890Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)40.50sTiempo de respuesta (máximo)72.14sTiempo de respuesta (total)121.51sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
6.4Puntaje promedio en todas las pruebas de benchmark.…
5.8La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Sin respuesta: 1Tiempo de respuesta (promedio)58.52sTiempo de respuesta (máximo)79.36sTiempo de respuesta (total)117.04sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
58.52sTiempo de respuesta (promedio)…
99,411Total de tokens de entrada…
9,809Tokens de salida…
13,940Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
8.7Puntaje promedio en todas las pruebas de benchmark.…
6.9La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
83.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Llamada de herramienta no válida: 1Tiempo de respuesta (promedio)124.48sTiempo de respuesta (máximo)214.63sTiempo de respuesta (total)248.96sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)9.07sTiempo de respuesta (máximo)12.19sTiempo de respuesta (total)18.14sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
9.07sTiempo de respuesta (promedio)…
8,562Total de tokens de entrada…
246Tokens de salida…
1,742Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
6.5Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
50.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)8.76sTiempo de respuesta (máximo)10.36sTiempo de respuesta (total)17.53sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.6Puntaje promedio en todas las pruebas de benchmark.…
7.2La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
22.2%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)84.35sTiempo de respuesta (máximo)168.71sTiempo de respuesta (total)253.05sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
84.35sTiempo de respuesta (promedio)…
852Total de tokens de entrada…
12Tokens de salida…
24,616Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
5.3Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)76.98sTiempo de respuesta (máximo)144.07sTiempo de respuesta (total)230.93sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
6.7Puntaje promedio en todas las pruebas de benchmark.…
3.6La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)18.25sTiempo de respuesta (máximo)18.25sTiempo de respuesta (total)18.25sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
18.25sTiempo de respuesta (promedio)…
582Total de tokens de entrada…
304Tokens de salida…
1,620Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
5.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)9.20sTiempo de respuesta (máximo)9.20sTiempo de respuesta (total)9.20sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)7.26sTiempo de respuesta (máximo)9.02sTiempo de respuesta (total)14.52sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
7.26sTiempo de respuesta (promedio)…
834Total de tokens de entrada…
71Tokens de salida…
1,480Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.54sTiempo de respuesta (máximo)2.67sTiempo de respuesta (total)5.07sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
9.0Puntaje promedio en todas las pruebas de benchmark.…
7.9La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
88.9%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)10.23sTiempo de respuesta (máximo)11.54sTiempo de respuesta (total)30.68sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.23sTiempo de respuesta (promedio)…
894Total de tokens de entrada…
403Tokens de salida…
3,285Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
8.3Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)12.62sTiempo de respuesta (máximo)29.62sTiempo de respuesta (total)37.85sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)12.38sTiempo de respuesta (máximo)12.38sTiempo de respuesta (total)12.38sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
12.38sTiempo de respuesta (promedio)…
9,306Total de tokens de entrada…
222Tokens de salida…
1,011Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Error de API: 1Tiempo de respuesta (promedio)0msTiempo de respuesta (máximo)0msTiempo de respuesta (total)0msUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)48.32sTiempo de respuesta (máximo)48.32sTiempo de respuesta (total)48.32sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
48.32sTiempo de respuesta (promedio)…
276Total de tokens de entrada…
9Tokens de salida…
2,040Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Sin respuesta: 1Tiempo de respuesta (promedio)11.29sTiempo de respuesta (máximo)11.29sTiempo de respuesta (total)11.29sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…