AI BENCHY Compare

OpenAI: gpt-oss-120b vs Qwen: Qwen3.5-35B-A3B

Last updated at: 2026-05-26

Metric	gpt-oss-120b gpt-oss-120b none Release: 2025-08-05 Free Available	Qwen3.5-35B-A3B Qwen3.5-35B-A3B none Release: 2026-02-24

Metric	gpt-oss-120b gpt-oss-120b none Release: 2025-08-05 Free Available	Qwen3.5-35B-A3B Qwen3.5-35B-A3B none Release: 2026-02-24
Score	5.4	5.8
Rank	#119	#104
Reliability	10.0	10.0
Consistency	9.1	8.9
Tests Correct
Attempt pass rate	38.6%	45.0%
Flaky tests	2	3
Total Runs	133	98
Cost per result	0.302	0.419
Total Cost	$0.019	$0.030
Input Price	$0.000 / 1M	$0.139 / 1M
Output Price	$0.000 / 1M	$1.000 / 1M
Output Tokens	91,564	10,794
Reasoning Tokens	0	0
Response Time (avg)	21.61s	3.50s
Response Time (max)	113.71s	47.43s
Response Time (total)	345.79s	70.00s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
gpt-oss-120b	6.5	10.0	50.0%	0		32.84s	8,676	0
Qwen3.5-35B-A3B	3.4	7.9	16.7%	1		1.43s	574	0

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
gpt-oss-120b	4.3	1.1	66.7%	1		9.57s	3,232	0
Qwen3.5-35B-A3B	6.8	10.0	50.0%	0		1.72s	562	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
gpt-oss-120b	3.0	10.0	0.0%	0		0ms	0	0
Qwen3.5-35B-A3B	3.0	10.0	0.0%	0		47.43s	1,833	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
gpt-oss-120b	6.5	10.0	50.0%	0		7.12s	598	0
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		1.16s	243	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
gpt-oss-120b	3.0	10.0	0.0%	0		34.98s	29,483	0
Qwen3.5-35B-A3B	7.7	10.0	66.7%	0		485ms	15	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
gpt-oss-120b	4.8	10.0	0.0%	0		10.79s	615	0
Qwen3.5-35B-A3B	6.5	3.4	66.7%	1		1.19s	114	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
gpt-oss-120b	9.8	10.0	100.0%	0		5.06s	10,870	0
Qwen3.5-35B-A3B	6.3	10.0	50.0%	0		809ms	63	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
gpt-oss-120b	6.0	7.2	55.6%	1		8.21s	34,952	0
Qwen3.5-35B-A3B	3.7	7.4	22.2%	1		1.35s	7,115	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
gpt-oss-120b	3.0	10.0	0.0%	0		0ms	0	0
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		2.30s	264	0

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
gpt-oss-120b	3.0	10.0	0.0%	0		47.29s	3,138	0
Qwen3.5-35B-A3B	3.0	10.0	0.0%	0		493ms	11	0

Quick Compare

Switch Comparison Pair

MiniMax M2.5mediumFree Availablevsgpt-oss-120bnoneFree Available Mistral Small 4mediumvsgpt-oss-120bnoneFree Available Owl AlphamediumvsQwen3.5-35B-A3Bnone CobuddymediumFree AvailablevsQwen3.5-35B-A3Bnone gpt-oss-120bnoneFree AvailablevsElephant Alphamedium MiniMax M2.7mediumvsgpt-oss-120bnoneFree Available gpt-oss-120bmediumFree AvailablevsQwen3.5-35B-A3Bnone Nemotron 3 SupermediumFree AvailablevsQwen3.5-35B-A3Bnone GPT-5 NanomediumvsQwen3.5-35B-A3Bnone CobuddymediumFree Availablevsgpt-oss-120bnoneFree Available MiniMax M2.5mediumFree AvailablevsQwen3.5-35B-A3Bnone Mistral Small 4mediumvsQwen3.5-35B-A3Bnone