AI BENCHY Compare

DeepSeek: DeepSeek V3.2 vs OpenAI: gpt-oss-120b

Last updated at: 2026-06-01

Metric	DeepSeek V3.2 DeepSeek V3.2 none Release: 2025-12-01	gpt-oss-120b gpt-oss-120b medium Release: 2025-08-05 Free Available

Metric	DeepSeek V3.2 DeepSeek V3.2 none Release: 2025-12-01	gpt-oss-120b gpt-oss-120b medium Release: 2025-08-05 Free Available
Score	5.6	5.9
Rank	#120	#103
Reliability	10.0	10.0
Consistency	8.3	7.9
Tests Correct
Attempt pass rate	41.7%	50.0%
Flaky tests	6	5
Total Runs	60	60
Cost per result	0.222	0.151
Total Cost	$0.018	$0.012
Input Price	$0.252 / 1M	$0.000 / 1M
Output Price	$0.378 / 1M	$0.000 / 1M
Output Tokens	11,159	17,495
Reasoning Tokens	0	46,878
Response Time (avg)	14.43s	22.41s
Response Time (max)	115.89s	68.16s
Response Time (total)	288.55s	291.35s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
DeepSeek V3.2	3.2	8.2	8.3%	1		9.35s	1,073	0
gpt-oss-120b	6.7	9.9	50.0%	0		10.21s	3,518	2,177

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
DeepSeek V3.2	3.1	5.4	16.7%	1		20.87s	4,522	0
gpt-oss-120b	3.9	5.6	33.3%	1		47.24s	847	8,618

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
DeepSeek V3.2	6.5	10.0	0.0%	0		115.89s	2,887	0
gpt-oss-120b	10.0	10.0	100.0%	0		31.18s	694	5,072

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
DeepSeek V3.2	6.3	5.8	66.7%	1		9.42s	1,710	0
gpt-oss-120b	6.4	5.9	66.7%	1		1.98s	241	1,114

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
DeepSeek V3.2	2.9	6.9	11.1%	1		4.17s	21	0
gpt-oss-120b	2.9	4.4	22.2%	2		50.92s	6,784	20,606

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
DeepSeek V3.2	6.8	10.0	66.7%	1		9.32s	43	0
gpt-oss-120b	4.3	10.0	0.0%	0		7.90s	107	387

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
DeepSeek V3.2	10.0	10.0	100.0%	0		1.52s	66	0
gpt-oss-120b	9.9	10.0	100.0%	0		7.63s	126	1,799

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
DeepSeek V3.2	8.3	10.0	77.8%	1		6.91s	298	0
gpt-oss-120b	5.3	7.2	44.4%	1		21.71s	1,790	2,264

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
DeepSeek V3.2	10.0	10.0	100.0%	0		11.85s	522	0
gpt-oss-120b	9.8	10.0	100.0%	0		6.91s	287	1,083

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
DeepSeek V3.2	3.0	10.0	0.0%	0		17.23s	17	0
gpt-oss-120b	3.0	10.0	0.0%	0		26.51s	3,101	3,758

Quick Compare

Switch Comparison Pair

gpt-oss-120bmediumFree AvailablevsQwen3.5-Flashnone gpt-oss-120bmediumFree AvailablevsGLM 5V Turbonone Seed-2.0-Litenonevsgpt-oss-120bmediumFree Available DeepSeek V4 Prononevsgpt-oss-120bmediumFree Available gpt-oss-120bmediumFree AvailablevsGLM 5.1none DeepSeek V3.2nonevsMiniMax M2.5medium gpt-oss-120bmediumFree AvailablevsQwen3.5 Plus 2026-04-20none gpt-oss-120bmediumFree AvailablevsQwen3.5-35B-A3Bnone gpt-oss-120bmediumFree AvailablevsQwen3.5-27Bnone gpt-oss-120bmediumFree AvailablevsQwen3.6 27Bnone DeepSeek V3.2nonevsMistral Small 4medium CobuddymediumvsDeepSeek V3.2none