AI BENCHY Compare

ByteDance Seed: Seed-2.0-Lite vs OpenAI: GPT-5.4

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-06-03

Metrik	Seed-2.0-Lite Seed-2.0-Lite none Rilis: 2026-02-14	GPT-5.4 GPT-5.4 none Rilis: 2026-03-05

Metrik	Seed-2.0-Lite Seed-2.0-Lite none Rilis: 2026-02-14	GPT-5.4 GPT-5.4 none Rilis: 2026-03-05
Skor	5.9	5.6
Peringkat	#106	#121
Keandalan	10.0	10.0
Konsistensi	8.3	9.1
Tes benar
Tingkat lulus per percobaan	48.3%	38.3%
Tes tidak stabil	4	2
Total Run	60	60
Biaya per hasil	0.218	1.644
Total Biaya	$0.018	$0.116
Harga input	$0.250 / 1M	$2.500 / 1M
Harga output	$2.000 / 1M	$15.000 / 1M
Total token input	43,630	31,593
Token output	3,253	2,402
Token penalaran	0	0
Waktu respons (rata-rata)	2.48s	1.45s
Waktu respons (maks)	6.70s	2.95s
Waktu respons (total)	49.67s	29.00s

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Seed-2.0-Lite	3.0	5.9	16.7%	2		2.43s	894	709	0
GPT-5.4	3.2	8.0	8.3%	1		1.21s	606	406	0

Pemrograman	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Seed-2.0-Lite	6.8	9.9	50.0%	0		2.95s	5,272	404	0
GPT-5.4	6.8	10.0	50.0%	0		1.99s	4,686	501	0

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Seed-2.0-Lite	3.0	10.0	0.0%	0		6.59s	16,215	498	0
GPT-5.4	3.0	10.0	0.0%	0		2.89s	11,019	291	0

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Seed-2.0-Lite	10.0	10.0	100.0%	0		1.82s	8,538	246	0
GPT-5.4	10.0	10.0	100.0%	0		1.04s	7,140	222	0

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Seed-2.0-Lite	3.6	7.2	22.2%	1		1.33s	939	17	0
GPT-5.4	5.3	7.2	44.4%	1		1.07s	723	50	0

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Seed-2.0-Lite	10.0	10.0	100.0%	0		3.45s	570	294	0
GPT-5.4	4.4	9.9	0.0%	0		1.78s	477	184	0

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Seed-2.0-Lite	10.0	10.0	100.0%	0		1.06s	810	73	0
GPT-5.4	6.5	10.0	50.0%	0		1.07s	660	81	0

Pemecahan teka-teki	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Seed-2.0-Lite	5.3	7.2	44.4%	1		2.78s	858	709	0
GPT-5.4	5.6	9.8	33.3%	0		1.44s	642	381	0

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Seed-2.0-Lite	10.0	10.0	100.0%	0		3.94s	9,270	292	0
GPT-5.4	10.0	10.0	100.0%	0		2.75s	5,445	246	0

Pengetahuan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Seed-2.0-Lite	3.0	10.0	0.0%	0		1.96s	264	11	0
GPT-5.4	3.0	10.0	0.0%	0		990ms	195	40	0

Perbandingan Cepat

Ganti Pasangan Perbandingan

Seed-2.0-LitenonevsOwl Alphamedium Seed-2.0-Litenonevsgpt-oss-120bmediumTersedia gratis Seed-2.0-LitenonevsNemotron 3 SupermediumTersedia gratis MiniMax M2.5mediumvsGPT-5.4none CobuddymediumvsSeed-2.0-Litenone CobuddymediumvsGPT-5.4none MiniMax M2.7mediumvsGPT-5.4none Mistral Small 4mediumvsGPT-5.4none Seed-2.0-LitenonevsDeepSeek V4 Prohigh Seed-2.0-LitenonevsGPT-5 Nanomedium GPT-5.4nonevsOwl Alphamedium GPT-5.4nonevsElephant Alphamedium