AI BENCHY Compare

Anthropic: Claude Opus 4.6 vs Google: Gemma 4 31B

Last updated at: 2026-04-04

Metric	Claude Opus 4.6 Claude Opus 4.6 medium Release: 2026-02-05	Gemma 4 31B Gemma 4 31B none Release: 2026-04-02

Metric	Claude Opus 4.6 Claude Opus 4.6 medium Release: 2026-02-05	Gemma 4 31B Gemma 4 31B none Release: 2026-04-02
Score	7.5	6.7
Rank	#34	#48
Consistency	9.0	10.0
Tests Correct
Attempt pass rate	68.6%	52.9%
Flaky tests	2	0
Total Runs	51	51
Cost per result	11.973	0.023
Total Cost	$1.317	$0.002
Input Price	$5.000 / 1M	$0.140 / 1M
Output Price	$25.000 / 1M	$0.400 / 1M
Output Tokens	26,343	660
Reasoning Tokens	17,434	0
Response Time (avg)	20.87s	2.55s
Response Time (max)	83.40s	4.68s
Response Time (total)	208.73s	38.20s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.6	6.4	5.8	66.7%	2		7.45s	986	1,071
Gemma 4 31B	6.5	10.0	50.0%	0		1.85s	45	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.6	10.0	10.0	100.0%	0		76.66s	8,178	5,194
Gemma 4 31B	3.0	10.0	0.0%	0		0ms	0	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.6	10.0	10.0	100.0%	0		7.37s	691	757
Gemma 4 31B	10.0	10.0	100.0%	0		2.25s	285	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.6	3.0	10.0	0.0%	0		83.40s	14,642	8,687
Gemma 4 31B	7.7	10.0	66.7%	0		3.22s	27	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.6	10.0	10.0	100.0%	0		5.04s	188	292
Gemma 4 31B	10.0	10.0	100.0%	0		2.09s	117	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.6	10.0	10.0	100.0%	0		2.43s	266	467
Gemma 4 31B	6.5	10.0	50.0%	0		2.84s	78	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.6	7.7	10.0	66.7%	0		4.60s	531	637
Gemma 4 31B	5.5	10.0	33.3%	0		2.95s	108	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Claude Opus 4.6	10.0	10.0	100.0%	0		9.73s	861	329
Gemma 4 31B	3.0	10.0	0.0%	0		0ms	0	0

Quick Compare

Switch Comparison Pair

Claude Opus 4.6mediumvsGPT-5.3 Chatnone Gemma 4 31BnonevsGPT-5 Minimedium Gemma 4 31BnonevsNemotron 3 SupermediumFree Available Gemma 4 31BnonevsGrok 4.1 Fastmedium Gemma 4 31BnonevsHunter Alphamedium Claude Opus 4.6mediumvsGPT-5.2 Chatnone Claude Opus 4.6mediumvsGemini 3.1 Flash Lite Previewnone Gemma 4 31BnonevsGPT-5.4 Minimedium Gemma 4 31BnonevsGrok 4.20medium Gemma 4 31BnonevsMercury 2medium Gemma 4 31BnonevsGPT-5 Nanomedium Gemma 4 31BnonevsKimi K2.5medium