AI BENCHY Compare

Google: Gemini 3.1 Pro Preview vs OpenAI: gpt-oss-120b

Last updated at: 2026-04-29

Metric	Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Release: 2026-02-19	gpt-oss-120b gpt-oss-120b medium Release: 2025-08-05 Free Available

Metric	Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Release: 2026-02-19	gpt-oss-120b gpt-oss-120b medium Release: 2025-08-05 Free Available
Score	9.6	5.8
Rank	#2	#88
Reliability	N/A	N/A
Consistency	10.0	7.2
Tests Correct
Attempt pass rate	94.4%	51.9%
Flaky tests	0	6
Total Runs	54	54
Cost per result	3.400	0.144
Total Cost	$0.578	$0.011
Input Price	$2.000 / 1M	$0.000 / 1M
Output Price	$12.000 / 1M	$0.000 / 1M
Output Tokens	1,932	13,493
Reasoning Tokens	40,542	36,879
Response Time (avg)	15.96s	16.08s
Response Time (max)	40.61s	50.92s
Response Time (total)	175.52s	176.88s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		7.90s	112	3,218
gpt-oss-120b	6.7	9.9	50.0%	0		10.21s	3,518	2,177

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		19.88s	405	4,201
gpt-oss-120b	4.3	1.1	66.7%	1		26.33s	228	2,549

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.1 Pro Preview	9.5	10.0	100.0%	0		40.61s	432	9,281
gpt-oss-120b	10.0	10.0	100.0%	0		31.18s	694	5,072

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		7.72s	279	3,904
gpt-oss-120b	6.4	5.9	66.7%	1		1.98s	241	1,114

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.1 Pro Preview	7.7	10.0	66.7%	0		32.73s	18	12,424
gpt-oss-120b	2.9	4.4	22.2%	2		50.92s	6,784	20,606

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		11.77s	108	1,179
gpt-oss-120b	4.3	10.0	0.0%	0		7.90s	107	387

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		9.56s	72	2,236
gpt-oss-120b	9.9	10.0	100.0%	0		7.63s	126	1,799

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		7.15s	232	3,117
gpt-oss-120b	3.2	4.7	22.2%	2		11.80s	1,508	2,092

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		23.15s	274	982
gpt-oss-120b	9.8	10.0	100.0%	0		6.91s	287	1,083

Quick Compare

Switch Comparison Pair

Kimi K2.6nonevsgpt-oss-120bmediumFree Available gpt-oss-120bmediumFree AvailablevsQwen3.5-27Bnone gpt-oss-120bmediumFree AvailablevsQwen3.5 Plus 2026-04-20none gpt-oss-120bmediumFree AvailablevsMiMo-V2.5-Pronone gpt-oss-120bmediumFree AvailablevsQwen3.6 Flashnone gpt-oss-120bmediumFree AvailablevsQwen3.5-122B-A10Bnone gpt-oss-120bmediumFree AvailablevsMiMo-V2-Pronone DeepSeek V3.2nonevsgpt-oss-120bmediumFree Available gpt-oss-120bmediumFree AvailablevsQwen3.6 27Bnone DeepSeek V4 Prononevsgpt-oss-120bmediumFree Available gpt-oss-120bmediumFree AvailablevsGLM 4.7 Flashnone gpt-oss-120bmediumFree AvailablevsGLM 5.1none