AI BENCHY Compare

ByteDance Seed: Seed-2.0-Lite vs Qwen: Qwen3.5-9B

Last updated at: 2026-03-12

Metric	Seed-2.0-Lite Seed-2.0-Lite none Release: 2026-02-14	Qwen3.5-9B Qwen3.5-9B medium Release: 2026-03-02

Metric	Seed-2.0-Lite Seed-2.0-Lite none Release: 2026-02-14	Qwen3.5-9B Qwen3.5-9B medium Release: 2026-03-02
Rank	#45	#66
Avg Score	4.9	2.6
Consistency	7.4	7.4
Cost per result	0.214	0.779
Total Cost	$0.015	$0.024
Tests Correct
Attempt pass rate	56.3%	35.4%
Flaky tests	5	5
Total Runs	48	48
Output Tokens	2,743	17,930
Reasoning Tokens	0	139,706
Response Time (avg)	2.49s	71.44s
Response Time (max)	6.70s	226.38s
Response Time (total)	39.91s	928.77s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Avg Score vs Response Time (avg)

Total Output Tokens

Avg Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	4.6	22.2%	2		2.93s	703	0
Qwen3.5-9B	4.0	7.2	55.6%	1		31.54s	2,410	10,913

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	0.0%	0		6.59s	498	0
Qwen3.5-9B	10.0	10.0	0.0%	0		0ms	0	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	9.9	10.0	100.0%	0		1.82s	246	0
Qwen3.5-9B	5.0	5.6	33.3%	1		87.31s	1,383	32,113

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	7.2	22.2%	1		1.33s	17	0
Qwen3.5-9B	10.0	7.2	22.2%	1		137.75s	11,549	48,475

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		3.45s	294	0
Qwen3.5-9B	10.0	1.6	33.3%	1		226.38s	0	30,695

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		1.06s	73	0
Qwen3.5-9B	5.5	5.8	66.7%	1		17.15s	599	4,517

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	4.0	4.4	55.6%	2		2.46s	620	0
Qwen3.5-9B	10.0	10.0	0.0%	0		33.38s	1,545	11,844

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		3.94s	292	0
Qwen3.5-9B	10.0	10.0	100.0%	0		4.31s	444	1,149

Quick Compare

Switch Comparison Pair

Seed-2.0-LitenonevsGrok 4.20 Multi-Agent Betamedium Seed-2.0-Litenonevsgpt-oss-120bmediumFree Available Seed-2.0-LitenonevsMiniMax M2.5medium Qwen3.5-9BmediumvsMiMo-V2-Flashnone Qwen3.5-9BmediumvsGrok 4.1 Fastnone Seed-2.0-LitenonevsMercury 2medium Seed-2.0-LitenonevsQwen3.5-35B-A3Bmedium Seed-2.0-LitenonevsGPT-5 Nanomedium Mercury 2nonevsQwen3.5-9Bmedium Nemotron 3 Super 120b A12bnoneFree AvailablevsQwen3.5-9Bmedium Seed-2.0-LitenonevsNemotron 3 Super 120b A12bmediumFree Available Seed-2.0-LitenonevsHunter Alphamedium