AI BENCHY Compare

Inception: Mercury 2 vs OpenAI: GPT-5 Nano

Last updated at: 2026-05-22

Metric	Mercury 2 Mercury 2 medium Release: 2026-02-24	GPT-5 Nano GPT-5 Nano medium Release: 2025-08-07

Metric	Mercury 2 Mercury 2 medium Release: 2026-02-24	GPT-5 Nano GPT-5 Nano medium Release: 2025-08-07
Score	6.3	6.1
Rank	#90	#94
Reliability	10.0	10.0
Consistency	8.4	7.1
Tests Correct
Attempt pass rate	50.0%	55.0%
Flaky tests	4	7
Total Runs	60	60
Cost per result	0.687	0.945
Total Cost	$0.055	$0.076
Input Price	$0.250 / 1M	$0.050 / 1M
Output Price	$0.750 / 1M	$0.400 / 1M
Output Tokens	4,015	5,338
Reasoning Tokens	58,382	179,584
Response Time (avg)	2.27s	43.11s
Response Time (max)	14.63s	204.02s
Response Time (total)	43.15s	560.45s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Mercury 2	6.9	9.9	50.0%	0		1.12s	2,546	2,609
GPT-5 Nano	6.5	7.9	58.3%	1		25.50s	1,221	21,184

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Mercury 2	7.2	6.5	66.7%	1		2.29s	270	8,514
GPT-5 Nano	5.4	6.6	33.3%	1		47.80s	604	30,144

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Mercury 2	10.0	10.0	100.0%	0		3.28s	268	4,887
GPT-5 Nano	10.0	10.0	100.0%	0		65.96s	578	17,984

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Mercury 2	7.3	5.9	83.3%	1		1.11s	183	1,656
GPT-5 Nano	3.7	1.7	50.0%	2		21.42s	453	10,560

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Mercury 2	2.9	7.2	11.1%	1		6.48s	41	30,754
GPT-5 Nano	5.2	4.4	55.6%	2		204.02s	237	64,448

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Mercury 2	4.8	10.0	0.0%	0		821ms	137	542
GPT-5 Nano	4.1	10.0	0.0%	0		17.51s	202	4,608

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Mercury 2	10.0	10.0	100.0%	0		1.07s	14	958
GPT-5 Nano	9.8	10.0	100.0%	0		11.90s	382	4,096

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Mercury 2	3.8	7.3	22.2%	1		934ms	354	2,758
GPT-5 Nano	5.3	7.2	44.4%	1		19.81s	869	13,440

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Mercury 2	10.0	10.0	100.0%	0		1.89s	180	1,956
GPT-5 Nano	10.0	10.0	100.0%	0		33.30s	558	6,976

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Mercury 2	3.0	10.0	0.0%	0		2.58s	22	3,748
GPT-5 Nano	3.0	10.0	0.0%	0		20.13s	234	6,144

Quick Compare

Switch Comparison Pair

Mercury 2mediumvsGLM 5none GPT-5 NanomediumvsMiMo-V2-Omninone DeepSeek V4 PrononevsGPT-5 Nanomedium Gemini 2.5 FlashnonevsGPT-5 Nanomedium Gemma 4 26B A4BnoneFree AvailablevsGPT-5 Nanomedium Gemma 4 26B A4BnoneFree AvailablevsMercury 2medium Gemini 2.5 FlashnonevsMercury 2medium Mercury 2mediumvsMiMo-V2-Omninone Mercury 2mediumvsQwen3.5 Plus 2026-02-15none GPT-5 NanomediumvsQwen3.5-Flashnone GPT-5 NanomediumvsGLM 5none GPT-5 NanomediumvsGLM 5V Turbonone