Compare Charts Methodology

Language:

❤️ Made by XCS

AI BENCHY Compare

ByteDance Seed: Seed-2.0-Mini vs OpenAI: GPT-5.4

Compare:

Last updated at: 2026-03-06

Metric	ByteDance Seed: Seed-2.0-Mini medium Release: 2026-02-14	OpenAI: GPT-5.4 none Release: 2026-03-05
Avg Score	7.0	4.6
Rank	#23	#44
Tests Correct
Consistency	9.4	8.9
Cost per result	0.261	1.496
Total Cost	$0.027	$0.090
Attempt pass rate	71.1%	44.4%
Flaky tests	1	2
common.totalRuns	45 (15 x 3)	45 (15 x 3)
Output Tokens	1,752	1,635
Reasoning Tokens	54,246	0
Response Time (avg)	67.46s	1.46s
Response Time (max)	262.83s	2.89s
Response Time (total)	809.49s	21.86s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Avg Score vs Response Time (avg)

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
ByteDance Seed: Seed-2.0-Mini	7.0	10.0	66.7%	0		98.99s	354	9,352
OpenAI: GPT-5.4	10.0	7.3	11.1%	1		1.41s	388	0

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
ByteDance Seed: Seed-2.0-Mini	10.0	10.0	100.0%	0		262.83s	404	29,806
OpenAI: GPT-5.4	10.0	10.0	0.0%	0		2.89s	291	0

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
ByteDance Seed: Seed-2.0-Mini	9.9	10.0	100.0%	0		24.27s	246	2,743
OpenAI: GPT-5.4	9.9	10.0	100.0%	0		1.04s	222	0

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
ByteDance Seed: Seed-2.0-Mini	10.0	10.0	0.0%	0		0ms	0	0
OpenAI: GPT-5.4	4.0	7.2	44.4%	1		1.07s	50	0

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
ByteDance Seed: Seed-2.0-Mini	10.0	10.0	100.0%	0		17.47s	69	2,050
OpenAI: GPT-5.4	5.5	10.0	50.0%	0		1.07s	81	0

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
ByteDance Seed: Seed-2.0-Mini	7.0	7.2	88.9%	1		25.85s	457	5,060
OpenAI: GPT-5.4	4.0	9.8	33.3%	0		1.52s	357	0

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
ByteDance Seed: Seed-2.0-Mini	10.0	10.0	100.0%	0		88.68s	222	5,235
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		2.75s	246	0

Quick Compare

Switch Comparison Pair

Seed-2.0-MinimediumvsGemini 3 Flash Previewnone Claude Sonnet 4.6nonevsSeed-2.0-Minimedium MiniMax M2.5mediumvsGPT-5.4none Seed-2.0-MinimediumvsGemini 3.1 Flash Lite Previewnone Seed-2.0-MinimediumvsGPT-5.3 Chatnone Seed-2.0-MinimediumvsQwen3.5 Plus 2026-02-15none Seed-2.0-MinimediumvsGemini 3.1 Flash Lite Previewlow Seed-2.0-MinimediumvsGPT-5.2 Chatnone Mercury 2mediumvsGPT-5.4none Seed-2.0-MinimediumvsGemini 3.1 Flash Lite Previewhigh Seed-2.0-MinimediumvsGemini 3 Flash Previewlow Seed-2.0-MinimediumvsGLM 5none