AI BENCHY Compare

Google: Gemini 3.1 Flash Lite Preview vs OpenAI: GPT-5.2 Chat

Last updated at: 2026-04-16

Metric	Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview none Release: 2026-03-03	GPT-5.2 Chat GPT-5.2 Chat none Release: 2025-12-11

Metric	Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview none Release: 2026-03-03	GPT-5.2 Chat GPT-5.2 Chat none Release: 2025-12-11
Score	7.9	7.9
Rank	#29	#28
Consistency	9.6	8.7
Tests Correct
Attempt pass rate	70.4%	75.9%
Flaky tests	1	3
Total Runs	54	54
Cost per result	0.130	2.424
Total Cost	$0.016	$0.291
Input Price	$0.250 / 1M	$1.750 / 1M
Output Price	$1.500 / 1M	$14.000 / 1M
Output Tokens	5,361	17,346
Reasoning Tokens	0	0
Response Time (avg)	1.30s	6.84s
Response Time (max)	3.39s	38.52s
Response Time (total)	23.42s	123.17s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.1 Flash Lite Preview	7.5	8.4	66.7%	1		1.04s	1,092	0
GPT-5.2 Chat	8.7	7.9	91.7%	1		3.40s	1,807	0

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		1.47s	640	0
GPT-5.2 Chat	10.0	10.0	100.0%	0		8.97s	1,345	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.1 Flash Lite Preview	3.0	10.0	0.0%	0		3.20s	339	0
GPT-5.2 Chat	10.0	10.0	100.0%	0		9.12s	1,243	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		1.22s	399	0
GPT-5.2 Chat	10.0	10.0	100.0%	0		3.05s	980	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.1 Flash Lite Preview	5.3	10.0	33.3%	0		942ms	568	0
GPT-5.2 Chat	5.3	10.0	33.3%	0		17.78s	7,810	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.1 Flash Lite Preview	4.0	10.0	0.0%	0		741ms	69	0
GPT-5.2 Chat	4.4	3.0	33.3%	1		3.20s	335	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		1.13s	574	0
GPT-5.2 Chat	7.5	6.1	83.3%	1		5.46s	1,528	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		972ms	898	0
GPT-5.2 Chat	7.7	10.0	66.7%	0		4.42s	1,743	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		3.39s	782	0
GPT-5.2 Chat	10.0	10.0	100.0%	0		4.68s	555	0

Quick Compare

Switch Comparison Pair

Gemini 3.1 Flash Lite PreviewnonevsStep 3.5 Flashmedium GPT-5.2 ChatnonevsStep 3.5 Flashmedium DeepSeek V3.2mediumvsGPT-5.2 Chatnone DeepSeek V3.2mediumvsGemini 3.1 Flash Lite Previewnone Gemini 3.1 Flash Lite PreviewnonevsGLM 5V Turbomedium Gemini 3.1 Flash Lite PreviewnonevsQwen3.5-Flashmedium GPT-5.2 ChatnonevsGLM 5V Turbomedium Claude Sonnet 4.6mediumvsGPT-5.2 Chatnone GPT-5.2 ChatnonevsQwen3.5-Flashmedium Gemini 3.1 Flash Lite PreviewnonevsGLM 5.1medium Claude Sonnet 4.6mediumvsGemini 3.1 Flash Lite Previewnone Gemma 4 26B A4BmediumFree AvailablevsGPT-5.2 Chatnone