AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs Google: Gemini 3.1 Flash Lite Preview

Last updated at: 2026-05-28

Metric	Claude Opus 4.8 Claude Opus 4.8 none Release: 2026-05-28	Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview none Release: 2026-03-03

Metric	Claude Opus 4.8 Claude Opus 4.8 none Release: 2026-05-28	Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview none Release: 2026-03-03
Score	7.3	7.5
Rank	#63	#53
Reliability	10.0	10.0
Consistency	9.2	9.7
Tests Correct
Attempt pass rate	65.0%	63.3%
Flaky tests	2	1
Total Runs	60	60
Cost per result	4.324	0.142
Total Cost	$0.519	$0.017
Input Price	$5.000 / 1M	$0.250 / 1M
Output Price	$25.000 / 1M	$1.500 / 1M
Output Tokens	8,098	5,541
Reasoning Tokens	0	0
Response Time (avg)	3.51s	1.23s
Response Time (max)	17.73s	3.39s
Response Time (total)	70.19s	24.68s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	6.5	10.0	50.0%	0		3.40s	1,472	0
Gemini 3.1 Flash Lite Preview	7.5	8.4	66.7%	1		1.04s	1,092	0

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	6.8	10.0	50.0%	0		3.59s	1,323	0
Gemini 3.1 Flash Lite Preview	6.8	10.0	50.0%	0		1.06s	664	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	9.5	10.0	100.0%	0		17.73s	3,259	0
Gemini 3.1 Flash Lite Preview	3.0	10.0	0.0%	0		3.20s	339	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	7.3	5.8	83.3%	1		1.77s	308	0
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		1.22s	399	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	5.3	7.2	44.4%	1		1.66s	61	0
Gemini 3.1 Flash Lite Preview	5.3	10.0	33.3%	0		942ms	568	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	10.0	10.0	100.0%	0		3.48s	230	0
Gemini 3.1 Flash Lite Preview	4.0	10.0	0.0%	0		741ms	69	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	9.9	10.0	100.0%	0		1.37s	95	0
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		1.13s	574	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	7.7	10.0	66.7%	0		2.74s	783	0
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		900ms	1,045	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	10.0	10.0	100.0%	0		5.35s	355	0
Gemini 3.1 Flash Lite Preview	10.0	10.0	100.0%	0		3.39s	782	0

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.8	3.0	10.0	0.0%	0		3.41s	212	0
Gemini 3.1 Flash Lite Preview	3.0	10.0	0.0%	0		814ms	9	0

Quick Compare

Switch Comparison Pair

Claude Opus 4.8nonevsQwen3.5-35B-A3Bmedium Claude Opus 4.8nonevsRing-2.6-1Tmedium Gemini 3.1 Flash Lite PreviewnonevsGLM 5.1medium Claude Opus 4.8nonevsGPT-5.4 Minimedium Claude Opus 4.8nonevsGPT-5.2medium Gemini 3.1 Flash Lite PreviewnonevsMiMo-V2.5medium Gemini 3.1 Flash Lite PreviewnonevsKimi K2.6mediumFree Available Gemini 3.1 Flash Lite PreviewnonevsStep 3.5 Flashmedium Claude Opus 4.8nonevsGLM 5V Turbomedium Claude Opus 4.8nonevsGPT-5.4 Nanomedium Claude Sonnet 4.6mediumvsGemini 3.1 Flash Lite Previewnone Gemini 3.1 Flash Lite PreviewnonevsGLM 5V Turbomedium