Ling 3.1 Flash lidera en puntuación media con 5.5 vs 5.4. Ling 3.1 Flash tiene menor coste de benchmark con $0.000 vs ~$0.010. Qwen3.8 27B es más rápido con 5.05s vs 15.75s, con tasas de acierto de 33.3% vs 39.1%.
Benchmarks generados a partir de los suites de prueba de AI BENCHY en:
2026-10-03
Modelos comparados
Rango
#272
Total de tokens de salida
85,777
Tiempo de respuesta (promedio)
15.75s
Costo total
$0.000
Las respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
Rango
#279
Total de tokens de salida
13,791
Tiempo de respuesta (promedio)
5.05s
Costo total
~$0.010Solo se estima la electricidad de la GPU. No incluye el resto del ordenador ni la compra del hardware. NVIDIA GeForce RTX 3090: 0.0968 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.009566.
Modelo recomendadoQwen3.8 27B
Su puntuación se mantiene cerca de la mejor aquí (5.4 vs 5.5) y responde aproximadamente 3.1x más rápido que Ling 3.1 Flash.
Qwen3.8 27BQwen3.8 27BnoneLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.Lanzamiento: 2026-08-14Disponible gratis
Qwen3.8 27BQwen3.8 27BnoneLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.Lanzamiento: 2026-08-14Disponible gratis
Puntuación
5.5Puntaje promedio en todas las pruebas de benchmark.…
5.4Puntaje promedio en todas las pruebas de benchmark.…
Rango
#272
#279
Fiabilidad
9.8Puntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
10.0Puntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
Consistencia
8.4La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
39.1%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
Pruebas inestables
5Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Ejecuciones totales
69Ejecuciones totales…
69Ejecuciones totales…
Costo por resultado
0.000
~0.107Solo se estima la electricidad de la GPU. No incluye el resto del ordenador ni la compra del hardware. NVIDIA GeForce RTX 3090: 0.0968 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.009566.
Costo total
$0.000
~$0.010Solo se estima la electricidad de la GPU. No incluye el resto del ordenador ni la compra del hardware. NVIDIA GeForce RTX 3090: 0.0968 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.009566.
Precio de entrada
$0.000 / 1MPrecio de entrada…
N/DPrecio de entrada…
Precio de salida
$0.000 / 1MPrecio de salida…
N/DPrecio de salida…
Precio de lectura de caché
N/DPrecio de lectura de caché…
N/DPrecio de lectura de caché…
Precio de escritura de caché
N/DPrecio de escritura de caché…
N/DPrecio de escritura de caché…
Total de tokens de entrada
286,758Total de tokens de entrada…
281,460Total de tokens de entrada…
Tokens de salida
85,777Tokens de salida…
13,791Tokens de salida…
Tokens de razonamiento
0Tokens de razonamiento…
0Tokens de razonamiento…
Tiempo de respuesta (promedio)
15.75sTiempo de respuesta (promedio)…
5.05sTiempo de respuesta (promedio)…
Tiempo de respuesta (máximo)
90.95sTiempo de respuesta (máximo)…
47.42sTiempo de respuesta (máximo)…
Tiempo de respuesta (total)
362.23sTiempo de respuesta (total)…
116.11sTiempo de respuesta (total)…
Parámetros
560B en total (25B activos)
27.3B
Disponibilidad
Código cerrado
Pesos disponibles
Los precios de caché se aplican a los tokens de entrada. Las lecturas reutilizan instrucciones guardadas; las escrituras las almacenan y pueden costar más. Los tokens de salida usan el precio de salida.
Generación showcase de modelos
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#272 Ling 3.1 Flash
none
Coste
$0.000
Tiempo
171.4s
Tokens
20,178 tok
#279 Qwen3.8 27B
noneLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
Coste
~$0.001Solo se estima la electricidad de la GPU. No incluye el resto del ordenador ni la compra del hardware. NVIDIA GeForce RTX 3090: 0.0066 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.000657.
6.1Puntaje promedio en todas las pruebas de benchmark.…
3.1La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)68.68sTiempo de respuesta (máximo)68.68sTiempo de respuesta (total)68.68sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
68.68sTiempo de respuesta (promedio)…
163,444Total de tokens de entrada…
9,213Tokens de salida…
0Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
5.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)47.42sTiempo de respuesta (máximo)47.42sTiempo de respuesta (total)47.42sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.6Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 2Respuesta incorrecta: 2Tiempo de respuesta (promedio)2.02sTiempo de respuesta (máximo)3.69sTiempo de respuesta (total)8.09sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
2.02sTiempo de respuesta (promedio)…
762Total de tokens de entrada…
1,298Tokens de salida…
0Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
6.5Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
50.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)828msTiempo de respuesta (máximo)1.95sTiempo de respuesta (total)3.31sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
4.5Puntaje promedio en todas las pruebas de benchmark.…
7.5La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
22.2%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Formato extra: 1No siguió las instrucciones: 1Respuesta incorrecta: 1Tiempo de respuesta (promedio)31.85sTiempo de respuesta (máximo)71.62sTiempo de respuesta (total)95.56sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
31.85sTiempo de respuesta (promedio)…
8,307Total de tokens de entrada…
27,810Tokens de salida…
0Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
5.5Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)1.19sTiempo de respuesta (máximo)1.97sTiempo de respuesta (total)3.56sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
2.9Puntaje promedio en todas las pruebas de benchmark.…
5.8La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
16.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Llamada de herramienta no válida: 1Respuesta incorrecta: 1Tiempo de respuesta (promedio)25.41sTiempo de respuesta (máximo)45.68sTiempo de respuesta (total)50.82sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
25.41sTiempo de respuesta (promedio)…
92,441Total de tokens de entrada…
8,416Tokens de salida…
0Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Llamada de herramienta no válida: 1Respuesta incorrecta: 1Tiempo de respuesta (promedio)24.10sTiempo de respuesta (máximo)44.76sTiempo de respuesta (total)48.21sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)12.27sTiempo de respuesta (máximo)22.34sTiempo de respuesta (total)24.55sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
12.27sTiempo de respuesta (promedio)…
8,022Total de tokens de entrada…
249Tokens de salida…
0Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
6.5Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
50.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)1.14sTiempo de respuesta (máximo)1.18sTiempo de respuesta (total)2.27sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2No siguió las instrucciones: 1Tiempo de respuesta (promedio)1.72sTiempo de respuesta (máximo)2.72sTiempo de respuesta (total)5.15sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
1.72sTiempo de respuesta (promedio)…
846Total de tokens de entrada…
331Tokens de salida…
0Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
7.7Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)552msTiempo de respuesta (máximo)675msTiempo de respuesta (total)1.66sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
5.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)1.41sTiempo de respuesta (máximo)1.41sTiempo de respuesta (total)1.41sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
1.41sTiempo de respuesta (promedio)…
549Total de tokens de entrada…
131Tokens de salida…
0Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
4.2Puntaje promedio en todas las pruebas de benchmark.…
9.9La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)1.31sTiempo de respuesta (máximo)1.31sTiempo de respuesta (total)1.31sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
8.0Puntaje promedio en todas las pruebas de benchmark.…
6.8La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)1.22sTiempo de respuesta (máximo)1.23sTiempo de respuesta (total)2.45sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
1.22sTiempo de respuesta (promedio)…
750Total de tokens de entrada…
78Tokens de salida…
0Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
6.3Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
50.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)582msTiempo de respuesta (máximo)633msTiempo de respuesta (total)1.16sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
7.7Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)3.31sTiempo de respuesta (máximo)5.80sTiempo de respuesta (total)9.92sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.31sTiempo de respuesta (promedio)…
756Total de tokens de entrada…
2,073Tokens de salida…
0Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
6.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
33.3%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Respuesta incorrecta: 1Tiempo de respuesta (promedio)1.25sTiempo de respuesta (máximo)1.84sTiempo de respuesta (total)3.76sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
4.7Puntaje promedio en todas las pruebas de benchmark.…
1.6La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Sin respuesta: 1Tiempo de respuesta (promedio)4.66sTiempo de respuesta (máximo)4.66sTiempo de respuesta (total)4.66sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
4.66sTiempo de respuesta (promedio)…
10,650Total de tokens de entrada…
303Tokens de salida…
0Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.75sTiempo de respuesta (máximo)2.75sTiempo de respuesta (total)2.75sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Sin respuesta: 1Tiempo de respuesta (promedio)90.95sTiempo de respuesta (máximo)90.95sTiempo de respuesta (total)90.95sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
90.95sTiempo de respuesta (promedio)…
231Total de tokens de entrada…
35,875Tokens de salida…
0Tokens de razonamiento…
Qwen3.8 27BLas respuestas del modelo candidato se generaron en hardware local. OpenRouter se usó solo para evaluar.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)703msTiempo de respuesta (máximo)703msTiempo de respuesta (total)703msUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…