AI BENCHY Compare

ByteDance Seed: Seed-2.0-Lite vs Owl Alpha

Last updated at: 2026-04-30

Metric	Seed-2.0-Lite Seed-2.0-Lite none Release: 2026-02-14	Owl Alpha Owl Alpha medium Release: 2026-04-30

Metric	Seed-2.0-Lite Seed-2.0-Lite none Release: 2026-02-14	Owl Alpha Owl Alpha medium Release: 2026-04-30
Score	6.2	5.8
Rank	#79	#91
Reliability	N/A	10.0
Consistency	7.7	9.5
Tests Correct
Attempt pass rate	55.6%	40.7%
Flaky tests	5	1
Total Runs	54	54
Cost per result	0.200	0.000
Total Cost	$0.016	$0.000
Input Price	$0.250 / 1M	$0.000 / 1M
Output Price	$2.000 / 1M	$0.000 / 1M
Output Tokens	3,129	1,596
Reasoning Tokens	0	0
Response Time (avg)	2.53s	11.04s
Response Time (max)	6.70s	58.63s
Response Time (total)	45.46s	198.65s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	3.0	5.9	16.7%	2		2.43s	709	0
Owl Alpha	4.8	10.0	25.0%	0		3.97s	87	0

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		4.61s	380	0
Owl Alpha	10.0	10.0	100.0%	0		7.35s	402	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	3.0	10.0	0.0%	0		6.59s	498	0
Owl Alpha	3.0	10.0	0.0%	0		10.01s	315	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		1.82s	246	0
Owl Alpha	10.0	10.0	100.0%	0		21.64s	246	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	3.6	7.2	22.2%	1		1.33s	17	0
Owl Alpha	5.3	10.0	33.3%	0		8.58s	28	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		3.45s	294	0
Owl Alpha	4.3	10.0	0.0%	0		58.63s	98	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		1.06s	73	0
Owl Alpha	6.3	10.0	50.0%	0		9.59s	57	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	5.2	4.4	55.6%	2		2.46s	620	0
Owl Alpha	3.4	7.2	11.1%	1		3.44s	135	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		3.94s	292	0
Owl Alpha	10.0	10.0	100.0%	0		8.26s	228	0

Quick Compare

Switch Comparison Pair

Kimi K2.6nonevsOwl Alphamedium Seed-2.0-LitenonevsLaguna Xs.2mediumFree Available GPT-5.4nonevsOwl Alphamedium Owl AlphamediumvsQwen3.5-122B-A10Bnone Owl AlphamediumvsQwen3.5 Plus 2026-04-20none Owl AlphamediumvsMiMo-V2.5-Pronone Owl AlphamediumvsQwen3.6 Flashnone Owl AlphamediumvsGLM 5.1none Owl AlphamediumvsMiMo-V2-Pronone DeepSeek V3.2nonevsOwl Alphamedium Owl AlphamediumvsQwen3.5-27Bnone Seed-2.0-LitenonevsLaguna M.1mediumFree Available