AI BENCHY Compare

Google: Gemini 3.1 Flash Lite vs OpenAI: GPT-5.5

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-05-19

Métrica	Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite low Lanzamiento: 2026-05-08	GPT-5.5 GPT-5.5 medium Lanzamiento: 2026-04-24

Métrica	Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite low Lanzamiento: 2026-05-08	GPT-5.5 GPT-5.5 medium Lanzamiento: 2026-04-24
Puntuación	7.6	8.9
Rango	#49	#8
Fiabilidad	10.0	10.0
Consistencia	9.2	9.1
Pruebas correctas
Tasa de aciertos por intento	68.4%	87.7%
Pruebas inestables	2	2
Ejecuciones totales	57	57
Costo por resultado	0.203	18.365
Costo total	$0.025	$2.939
Precio de entrada	$0.250 / 1M	$5.000 / 1M
Precio de salida	$1.500 / 1M	$30.000 / 1M
Tokens de salida	2,702	1,950
Tokens de razonamiento	8,596	91,386
Tiempo de respuesta (promedio)	1.92s	33.02s
Tiempo de respuesta (máximo)	5.66s	332.10s
Tiempo de respuesta (total)	36.49s	627.45s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	7.3	6.2	75.0%	2		1.84s	1,013	1,548
GPT-5.5	10.0	10.0	100.0%	0		4.66s	250	1,335

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		1.46s	441	408
GPT-5.5	10.0	10.0	100.0%	0		9.09s	318	1,391

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	3.0	10.0	0.0%	0		4.48s	348	975
GPT-5.5	10.0	10.0	100.0%	0		19.29s	312	2,841

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		1.44s	291	697
GPT-5.5	10.0	10.0	100.0%	0		4.18s	234	593

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	5.3	10.0	33.3%	0		1.52s	15	1,214
GPT-5.5	5.3	7.2	44.4%	1		164.14s	67	79,625

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	4.0	10.0	0.0%	0		1.37s	69	438
GPT-5.5	10.0	10.0	100.0%	0		4.16s	138	223

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		1.52s	72	760
GPT-5.5	10.0	10.0	100.0%	0		3.36s	93	538

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		1.40s	210	1,191
GPT-5.5	10.0	10.0	100.0%	0		6.78s	250	2,254

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		5.66s	234	945
GPT-5.5	10.0	10.0	100.0%	0		10.57s	258	832

Cultura general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Gemini 3.1 Flash Lite	3.0	10.0	0.0%	0		1.46s	9	420
GPT-5.5	2.8	1.6	33.3%	1		37.86s	30	1,754

Comparación rápida

Cambiar par de comparación

Gemini 3.1 Flash LitelowvsStep 3.5 Flashmedium Gemini 3.1 Flash LitelowvsQwen3.5-Flashmedium Gemini 3.1 Flash LitelowvsKimi K2.6medium Gemini 3 Flash PreviewlowvsGPT-5.5medium Gemini 3.1 Flash LitelowvsGPT-5.3 Chatnone Gemini 3.1 Flash LitelowvsGPT-5.2 Chatnone Gemini 3.1 Flash LitelowvsGLM 5.1medium DeepSeek V4 FlashhighDisponible gratisvsGemini 3.1 Flash Litelow Gemini 3.1 Flash LitelowvsGLM 5V Turbomedium Gemini 3.1 Flash LitelowvsQwen3.6 Flashmedium Gemini 3.1 Flash LitelowvsMiMo-V2-Promedium Claude Sonnet 4.6mediumvsGemini 3.1 Flash Litelow