Comparar Gráficos

Idioma:

❤️ Made by XCS

AI BENCHY Compare

Google: Gemini 3.1 Flash Lite Preview vs OpenAI: GPT-5.3-Codex

Comparar:

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-03-03

Métrica	Google: Gemini 3.1 Flash Lite Preview none Lanzamiento: 2026-03-03	OpenAI: GPT-5.3-Codex medium Lanzamiento: 2026-02-05
Rango	#10	#7
Puntaje prom.	7.70	7.93
Consistencia	9.54	8.84
Costo por resultado	0.116	4.641
Costo total	$0.011	$0.465
Pruebas correctas
Tasa de aciertos por intento	69.1%	78.6%
Pruebas inestables	1	2
Tokens de salida	4,307	1,201
Tokens de razonamiento	0	30,056

Mejores modelos por puntuación

Puntuación vs costo total

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tokens de salida	Tokens de razonamiento
Google: Gemini 3.1 Flash Lite Preview	6.00	7.85	55.6%	1		1,086	0
OpenAI: GPT-5.3-Codex	10.00	10.00	100.0%	0		216	1,421

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tokens de salida	Tokens de razonamiento
Google: Gemini 3.1 Flash Lite Preview	9.88	10.00	100.0%	0		399	0
OpenAI: GPT-5.3-Codex	10.00	10.00	100.0%	0		234	735

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tokens de salida	Tokens de razonamiento
Google: Gemini 3.1 Flash Lite Preview	4.00	10.00	33.3%	0		568	0
OpenAI: GPT-5.3-Codex	4.00	7.21	55.6%	1		64	25,308

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tokens de salida	Tokens de razonamiento
Google: Gemini 3.1 Flash Lite Preview	9.00	10.00	50.0%	0		574	0
OpenAI: GPT-5.3-Codex	9.00	10.00	50.0%	0		93	693

Puzzle Solving	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tokens de salida	Tokens de razonamiento
Google: Gemini 3.1 Flash Lite Preview	10.00	10.00	100.0%	0		898	0
OpenAI: GPT-5.3-Codex	7.00	7.38	77.8%	1		340	1,407

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tokens de salida	Tokens de razonamiento
Google: Gemini 3.1 Flash Lite Preview	10.00	10.00	100.0%	0		782	0
OpenAI: GPT-5.3-Codex	10.00	10.00	100.0%	0		254	492

Comparación rápida

Cambiar par de comparación

Gemini 3.1 Flash Lite PreviewlowvsGPT-5.3-Codexmedium Gemini 3.1 Flash Lite PreviewhighvsGPT-5.3-Codexmedium Claude Sonnet 4.6mediumvsGemini 3.1 Flash Lite Previewnone Gemini 3.1 Flash Lite PreviewnonevsGLM 5medium Gemini 3 Flash PreviewlowvsGPT-5.3-Codexmedium Gemini 3.1 Flash Lite PreviewnonevsStep 3.5 FlashmediumDisponible gratis DeepSeek V3.2mediumvsGemini 3.1 Flash Lite Previewnone Gemini 3 Flash PreviewnonevsGPT-5.3-Codexmedium Gemini 3.1 Flash Lite PreviewnonevsGPT-5.2medium Gemini 3.1 Flash Lite PreviewnonevsQwen3.5-27Bmedium Gemini 3.1 Flash Lite PreviewnonevsQwen3.5-122B-A10Bmedium Gemini 3.1 Flash Lite PreviewnonevsQwen3.5 Plus 2026-02-15medium