AI BENCHY Compare

Google: Gemini 3.1 Flash Lite vs OpenAI: GPT-5.5

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-05-22

Métrica	Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite minimal Lanzamiento: 2026-05-08	GPT-5.5 GPT-5.5 medium Lanzamiento: 2026-04-24

Métrica	Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite minimal Lanzamiento: 2026-05-08	GPT-5.5 GPT-5.5 medium Lanzamiento: 2026-04-24
Puntuación	6.7	8.7
Rango	#78	#11
Fiabilidad	10.0	10.0
Consistencia	8.8	8.8
Pruebas correctas
Tasa de aciertos por intento	56.7%	86.7%
Pruebas inestables	3	3
Ejecuciones totales	60	60
Costo por resultado	0.123	21.891
Costo total	$0.013	$3.503
Precio de entrada	$0.250 / 1M	$5.000 / 1M
Precio de salida	$1.500 / 1M	$30.000 / 1M
Tokens de salida	2,481	1,973
Tokens de razonamiento	0	109,510
Tiempo de respuesta (promedio)	1.37s	37.89s
Tiempo de respuesta (máximo)	4.49s	332.10s
Tiempo de respuesta (total)	27.32s	757.71s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	8.3	10.0	75.0%	0		1.10s	639	0
GPT-5.5	10.0	10.0	100.0%	0		4.66s	250	1,335

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	6.8	10.0	50.0%	0		951ms	660	0
GPT-5.5	8.2	6.7	83.3%	1		69.68s	341	19,515

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	3.0	10.0	0.0%	0		2.53s	357	0
GPT-5.5	10.0	10.0	100.0%	0		19.29s	312	2,841

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		1.04s	279	0
GPT-5.5	10.0	10.0	100.0%	0		4.18s	234	593

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	2.9	7.2	11.1%	1		1.02s	15	0
GPT-5.5	5.3	7.2	44.4%	1		164.14s	67	79,625

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	4.0	10.0	0.0%	0		791ms	63	0
GPT-5.5	10.0	10.0	100.0%	0		4.16s	138	223

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		932ms	72	0
GPT-5.5	10.0	10.0	100.0%	0		3.36s	93	538

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	6.0	4.6	66.7%	2		2.15s	153	0
GPT-5.5	10.0	10.0	100.0%	0		6.78s	250	2,254

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		3.51s	234	0
GPT-5.5	10.0	10.0	100.0%	0		10.57s	258	832

Cultura general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	3.0	10.0	0.0%	0		724ms	9	0
GPT-5.5	2.8	1.6	33.3%	1		37.86s	30	1,754

Comparación rápida

Cambiar par de comparación

Gemini 3.1 Flash LiteminimalvsKimi K2.5medium DeepSeek V4 ProhighvsGemini 3.1 Flash Liteminimal Gemini 3.1 Flash LiteminimalvsGrok 4.20medium Gemini 3.1 Flash LiteminimalvsGrok Build 0.1none Gemini 3 Flash PreviewlowvsGPT-5.5medium Gemini 3.1 Flash LiteminimalvsQwen3.6 27Bmedium Gemini 3.1 Flash LiteminimalvsGPT-5.5none Gemini 3.5 FlashnonevsGPT-5.5medium Gemini 3.1 Flash LiteminimalvsGPT-5 Minimedium Gemini 3.1 Flash LiteminimalvsMiMo-V2-Omnimedium Gemini 3.1 Flash LiteminimalvsQwen3.5 Plus 2026-02-15none DeepSeek V3.2mediumvsGemini 3.1 Flash Liteminimal