AI BENCHY Compare

ByteDance Seed: Seed-2.0-Lite vs Qwen: Qwen3.7 Max

Last updated at: 2026-05-22

Metric	Seed-2.0-Lite Seed-2.0-Lite medium Release: 2026-02-14	Qwen3.7 Max Qwen3.7 Max none Release: 2026-05-22

Metric	Seed-2.0-Lite Seed-2.0-Lite medium Release: 2026-02-14	Qwen3.7 Max Qwen3.7 Max none Release: 2026-05-22
Score	8.1	7.9
Rank	#22	#27
Reliability	10.0	10.0
Consistency	8.9	10.0
Tests Correct
Attempt pass rate	75.0%	70.0%
Flaky tests	3	0
Total Runs	60	60
Cost per result	1.170	0.719
Total Cost	$0.153	$0.101
Input Price	$0.250 / 1M	$2.500 / 1M
Output Price	$2.000 / 1M	$7.500 / 1M
Output Tokens	3,282	1,988
Reasoning Tokens	67,287	0
Response Time (avg)	36.79s	1.30s
Response Time (max)	168.71s	3.92s
Response Time (total)	735.86s	25.95s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	8.3	10.0	75.0%	0		17.99s	996	7,142
Qwen3.7 Max	6.5	10.0	50.0%	0		1.08s	242	0

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	7.0	9.7	50.0%	0		107.65s	452	20,524
Qwen3.7 Max	6.8	10.0	50.0%	0		1.39s	576	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		37.67s	506	4,299
Qwen3.7 Max	3.0	10.0	0.0%	0		2.17s	171	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		9.07s	246	1,742
Qwen3.7 Max	10.0	10.0	100.0%	0		1.35s	243	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	5.9	7.2	55.6%	1		88.74s	15	23,897
Qwen3.7 Max	7.7	10.0	66.7%	0		975ms	15	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	6.7	3.6	66.7%	1		18.25s	304	1,620
Qwen3.7 Max	10.0	10.0	100.0%	0		1.04s	120	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		7.26s	71	1,480
Qwen3.7 Max	10.0	10.0	100.0%	0		943ms	72	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	9.0	7.9	88.9%	1		11.03s	461	3,532
Qwen3.7 Max	10.0	10.0	100.0%	0		1.13s	314	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		12.38s	222	1,011
Qwen3.7 Max	10.0	10.0	100.0%	0		3.92s	222	0

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	3.0	10.0	0.0%	0		48.32s	9	2,040
Qwen3.7 Max	3.0	10.0	0.0%	0		856ms	13	0

Quick Compare

Switch Comparison Pair

GPT-5.4mediumvsQwen3.7 Maxnone Qwen3.7 MaxnonevsGLM 5 Turbomedium Gemini 3.5 FlashminimalvsQwen3.7 Maxnone Qwen3.7 MaxnonevsMiMo-V2.5medium Gemma 4 31BmediumFree AvailablevsQwen3.7 Maxnone Seed-2.0-LitemediumvsGemini 3.5 Flashminimal Qwen3.7 MaxnonevsGrok 4.3medium Gemini 3.1 Flash Lite PreviewmediumvsQwen3.7 Maxnone Gemini 3.1 Flash LitemediumvsQwen3.7 Maxnone Gemini 2.5 FlashmediumvsQwen3.7 Maxnone Qwen3.7 MaxnonevsMiMo-V2.5-Promedium Gemini 3 PRO PreviewmediumvsQwen3.7 Maxnone