AI BENCHY Compare

Google: Gemini 3.1 Flash Lite Preview vs Qwen: Qwen3.5-Flash

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-03-15

Métrica	Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview medium Lanzamiento: 2026-03-03	Qwen3.5-Flash Qwen3.5-Flash none Lanzamiento: 2026-02-24

Métrica	Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview medium Lanzamiento: 2026-03-03	Qwen3.5-Flash Qwen3.5-Flash none Lanzamiento: 2026-02-24
Rango	#16	#42
Puntuación	8.0	6.2
Consistencia	10.0	9.6
Costo por resultado	0.443	0.077
Costo total	$0.049	$0.006
Pruebas correctas
Tasa de aciertos por intento	68.8%	45.8%
Pruebas inestables	0	1
Ejecuciones totales	48	48
Tokens de salida	1,731	3,774
Tokens de razonamiento	25,821	0
Tiempo de respuesta (promedio)	3.83s	3.54s
Tiempo de respuesta (máximo)	14.93s	13.73s
Tiempo de respuesta (total)	61.25s	56.70s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite Preview	8.8	10.0	66.7%	0		2.53s	564	3,780
Qwen3.5-Flash	3.7	7.8	11.1%	1		1.62s	687	0

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		14.93s	327	7,347
Qwen3.5-Flash	3.0	10.0	0.0%	0		6.22s	1,794	0

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		2.29s	279	2,952
Qwen3.5-Flash	10.0	10.0	100.0%	0		1.57s	243	0

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite Preview	3.0	10.0	0.0%	0		4.21s	18	5,325
Qwen3.5-Flash	7.7	10.0	66.7%	0		905ms	15	0

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		3.16s	96	1,488
Qwen3.5-Flash	10.0	10.0	100.0%	0		803ms	100	0

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		1.91s	72	2,121
Qwen3.5-Flash	6.3	10.0	50.0%	0		8.81s	63	0

Puzzle Solving	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite Preview	7.7	10.0	66.7%	0		3.58s	141	1,896
Qwen3.5-Flash	3.3	10.0	0.0%	0		5.90s	608	0

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		3.80s	234	912
Qwen3.5-Flash	10.0	10.0	100.0%	0		3.67s	264	0

Comparación rápida

Cambiar par de comparación

Gemini 3.1 Flash Lite PreviewmediumvsGPT-5.2 Chatnone gpt-oss-120bmediumDisponible gratisvsQwen3.5-Flashnone Qwen3.5-FlashnonevsGrok 4.20 Multi-Agent Betamedium Gemini 3.1 Flash Lite PreviewmediumvsGPT-5.3 Chatnone MiniMax M2.5mediumDisponible gratisvsQwen3.5-Flashnone GPT-5 NanomediumvsQwen3.5-Flashnone Mercury 2mediumvsQwen3.5-Flashnone Claude Sonnet 4.6nonevsGemini 3.1 Flash Lite Previewmedium Nemotron 3 Super 120b A12bmediumDisponible gratisvsQwen3.5-Flashnone GPT-5 MinimediumvsQwen3.5-Flashnone Qwen3.5-FlashnonevsGrok 4.1 Fastmedium Hunter AlphamediumvsQwen3.5-Flashnone