AI BENCHY Compare

Inception: Mercury 2 vs Qwen: Qwen3.5-122B-A10B

Last updated at: 2026-06-03

Metric	Mercury 2 Mercury 2 none Release: 2026-02-24	Qwen3.5-122B-A10B Qwen3.5-122B-A10B none Release: 2026-02-24

Metric	Mercury 2 Mercury 2 none Release: 2026-02-24	Qwen3.5-122B-A10B Qwen3.5-122B-A10B none Release: 2026-02-24
Score	4.6	5.4
Rank	#153	#131
Reliability	10.0	10.0
Consistency	9.1	9.5
Tests Correct
Attempt pass rate	25.0%	33.3%
Flaky tests	2	1
Total Runs	60	60
Cost per result	0.216	0.380
Total Cost	$0.009	$0.019
Input Price	$0.250 / 1M	$0.260 / 1M
Output Price	$0.750 / 1M	$2.080 / 1M
Total Input Tokens	25,515	44,894
Output Tokens	3,001	3,374
Reasoning Tokens	0	0
Response Time (avg)	614ms	3.38s
Response Time (max)	1.27s	46.00s
Response Time (total)	12.28s	67.55s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
Mercury 2	3.0	10.0	0.0%	0		483ms	631	286	0
Qwen3.5-122B-A10B	4.8	10.0	25.0%	0		1.59s	696	312	0

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
Mercury 2	3.5	9.4	0.0%	0		831ms	4,631	1,650	0
Qwen3.5-122B-A10B	4.0	5.5	33.3%	1		2.14s	5,072	684	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
Mercury 2	3.0	10.0	0.0%	0		606ms	4,821	131	0
Qwen3.5-122B-A10B	3.0	10.0	0.0%	0		46.00s	20,175	1,137	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
Mercury 2	7.3	5.9	83.3%	1		667ms	6,362	180	0
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		1.01s	7,794	243	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
Mercury 2	5.3	7.2	44.4%	1		534ms	784	46	0
Qwen3.5-122B-A10B	5.3	10.0	33.3%	0		465ms	789	15	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
Mercury 2	4.8	10.0	0.0%	0		628ms	495	159	0
Qwen3.5-122B-A10B	5.0	10.0	0.0%	0		1.12s	522	66	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
Mercury 2	6.5	10.0	50.0%	0		551ms	691	82	0
Qwen3.5-122B-A10B	6.3	10.0	50.0%	0		513ms	711	69	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
Mercury 2	3.1	10.0	0.0%	0		535ms	694	251	0
Qwen3.5-122B-A10B	3.8	10.0	0.0%	0		1.00s	714	575	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
Mercury 2	10.0	10.0	100.0%	0		1.27s	6,193	197	0
Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		2.04s	8,211	264	0

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
Mercury 2	3.0	10.0	0.0%	0		548ms	213	19	0
Qwen3.5-122B-A10B	3.0	10.0	0.0%	0		295ms	210	9	0

Quick Compare

Switch Comparison Pair

Mistral Small 4mediumvsQwen3.5-122B-A10Bnone MiniMax M2.7mediumvsQwen3.5-122B-A10Bnone Elephant AlphamediumvsQwen3.5-122B-A10Bnone MiniMax M2.5mediumvsQwen3.5-122B-A10Bnone Mercury 2nonevsQwen3 Coder Nextmedium Mercury 2nonevsGLM 4.7 Flashmedium Mercury 2nonevsQwen3.5-9Bmedium CobuddymediumvsQwen3.5-122B-A10Bnone Owl AlphamediumvsQwen3.5-122B-A10Bnone gpt-oss-120bmediumFree AvailablevsQwen3.5-122B-A10Bnone Nemotron 3 SupermediumFree AvailablevsQwen3.5-122B-A10Bnone Mercury 2nonevsElephant Alphamedium