AI BENCHY Compare

ByteDance Seed: Seed-2.0-Lite vs OpenAI: GPT-5.3 Chat

Last updated at: 2026-04-26

Metric	Seed-2.0-Lite Seed-2.0-Lite medium Release: 2026-02-14	GPT-5.3 Chat GPT-5.3 Chat none Release: 2026-03-03

Metric	Seed-2.0-Lite Seed-2.0-Lite medium Release: 2026-02-14	GPT-5.3 Chat GPT-5.3 Chat none Release: 2026-03-03
Score	8.6	7.7
Rank	#8	#44
Reliability	N/A	N/A
Consistency	8.8	8.6
Tests Correct
Attempt pass rate	83.3%	68.5%
Flaky tests	3	3
Total Runs	54	54
Cost per result	0.926	3.082
Total Cost	$0.121	$0.340
Input Price	$0.250 / 1M	$1.750 / 1M
Output Price	$2.000 / 1M	$14.000 / 1M
Output Tokens	3,257	20,784
Reasoning Tokens	52,042	0
Response Time (avg)	30.37s	5.88s
Response Time (max)	168.71s	18.33s
Response Time (total)	546.72s	105.90s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	8.3	10.0	75.0%	0		17.99s	996	7,142
GPT-5.3 Chat	6.7	8.1	58.3%	1		3.86s	3,167	0

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		74.49s	436	7,319
GPT-5.3 Chat	10.0	10.0	100.0%	0		9.32s	1,436	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		37.67s	506	4,299
GPT-5.3 Chat	10.0	10.0	100.0%	0		11.96s	2,614	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		9.07s	246	1,742
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.21s	942	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	5.9	7.2	55.6%	1		88.74s	15	23,897
GPT-5.3 Chat	3.5	4.4	33.3%	2		13.01s	8,264	0

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	6.7	3.6	66.7%	1		18.25s	304	1,620
GPT-5.3 Chat	4.6	10.0	0.0%	0		1.99s	319	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		7.26s	71	1,480
GPT-5.3 Chat	8.3	10.0	50.0%	0		3.29s	1,455	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	9.0	7.9	88.9%	1		11.03s	461	3,532
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.93s	1,726	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Seed-2.0-Lite	10.0	10.0	100.0%	0		12.38s	222	1,011
GPT-5.3 Chat	10.0	10.0	100.0%	0		8.36s	861	0

Quick Compare

Switch Comparison Pair

Claude Opus 4.6mediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsMiMo-V2-Omnimedium Kimi K2.6mediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsMiMo-V2.5medium Seed-2.0-LitemediumvsHY3 PreviewhighFree Available GPT-5.3 ChatnonevsGLM 5.1medium Seed-2.0-MinimediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsQwen3.5-Flashmedium GPT-5.3 ChatnonevsGLM 5V Turbomedium DeepSeek V4 FlashhighvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsMiMo-V2-Flashmedium Seed-2.0-LitemediumvsGemini 3 Flash Previewlow