AI BENCHY Compare

ByteDance Seed: Seed-2.0-Lite vs Inception: Mercury 2

Last updated at: 2026-03-12

Metric	Seed-2.0-Lite Seed-2.0-Lite none Release: 2026-02-14	Mercury 2 Mercury 2 medium Release: 2026-02-24

Metric	Seed-2.0-Lite Seed-2.0-Lite none Release: 2026-02-14	Mercury 2 Mercury 2 medium Release: 2026-02-24
Rank	#45	#40
Avg Score	4.9	5.3
Consistency	7.4	8.4
Cost per result	0.214	0.631
Total Cost	$0.015	$0.045
Tests Correct
Attempt pass rate	56.3%	54.2%
Flaky tests	5	3
Total Runs	48	48
Output Tokens	2,743	3,708
Reasoning Tokens	0	45,921
Response Time (avg)	2.49s	2.36s
Response Time (max)	6.70s	14.63s
Response Time (total)	39.91s	35.39s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Avg Score vs Response Time (avg)

Total Output Tokens

Avg Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	4.6	22.2%	2		2.93s	703	0
Mercury 2	7.3	9.8	66.7%	0		1.30s	2,531	2,410

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	0.0%	0		6.59s	498	0
Mercury 2	10.0	10.0	100.0%	0		3.28s	268	4,887

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	9.9	10.0	100.0%	0		1.82s	246	0
Mercury 2	5.5	5.9	83.3%	1		1.11s	183	1,656

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	7.2	22.2%	1		1.33s	17	0
Mercury 2	10.0	7.2	11.1%	1		6.48s	41	30,754

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		3.45s	294	0
Mercury 2	4.0	10.0	0.0%	0		821ms	137	542

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		1.06s	73	0
Mercury 2	10.0	10.0	100.0%	0		1.07s	14	958

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	4.0	4.4	55.6%	2		2.46s	620	0
Mercury 2	1.7	7.5	22.2%	1		934ms	354	2,758

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		3.94s	292	0
Mercury 2	10.0	10.0	100.0%	0		1.89s	180	1,956

Quick Compare

Switch Comparison Pair

Seed-2.0-LitenonevsGrok 4.20 Multi-Agent Betamedium Mercury 2mediumvsQwen3.5-Flashnone Gemini 2.5 FlashnonevsMercury 2medium Seed-2.0-Litenonevsgpt-oss-120bmediumFree Available DeepSeek V3.2nonevsMercury 2medium Seed-2.0-LitenonevsMiniMax M2.5medium Mercury 2mediumvsQwen3.5-122B-A10Bnone Mercury 2mediumvsQwen3.5-27Bnone Seed-2.0-LitenonevsQwen3.5-35B-A3Bmedium Seed-2.0-LitenonevsGPT-5 Nanomedium Mercury 2mediumvsQwen3.5-35B-A3Bnone Mercury 2mediumvsGLM 5none