AI BENCHY Compare

ByteDance Seed: Seed-2.0-Lite vs MiniMax: MiniMax M2.5

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-03-12

Metrică	Seed-2.0-Lite Seed-2.0-Lite none Lansare: 2026-02-14	MiniMax M2.5 MiniMax M2.5 medium Lansare: 2026-02-12

Metrică	Seed-2.0-Lite Seed-2.0-Lite none Lansare: 2026-02-14	MiniMax M2.5 MiniMax M2.5 medium Lansare: 2026-02-12
Rang	#45	#49
Scor mediu	4.9	4.7
Consistență	7.4	5.6
Cost per rezultat	0.214	4.981
Cost total	$0.015	$0.250
Teste corecte
Rată de trecere pe încercare	56.3%	60.4%
Teste instabile	5	9
Rulări totale	48	48
Tokenuri de ieșire	2,743	107,044
Tokenuri de raționament	0	206,190
Timp de răspuns (mediu)	2.49s	43.03s
Timp de răspuns (maxim)	6.70s	237.27s
Timp de răspuns (total)	39.91s	387.25s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor mediu vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor mediu vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Seed-2.0-Lite	10.0	4.6	22.2%	2		2.93s	703	0
MiniMax M2.5	9.3	7.9	88.9%	1		32.42s	286	45,112

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Seed-2.0-Lite	10.0	10.0	0.0%	0		6.59s	498	0
MiniMax M2.5	10.0	2.1	66.7%	1		60.39s	740	9,713

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Seed-2.0-Lite	9.9	10.0	100.0%	0		1.82s	246	0
MiniMax M2.5	10.0	1.7	66.7%	2		7.48s	266	3,835

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Seed-2.0-Lite	10.0	7.2	22.2%	1		1.33s	17	0
MiniMax M2.5	10.0	4.4	22.2%	2		237.27s	105,047	133,487

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Seed-2.0-Lite	10.0	10.0	100.0%	0		3.45s	294	0
MiniMax M2.5	3.0	2.5	33.3%	1		6.63s	25	1,686

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Seed-2.0-Lite	10.0	10.0	100.0%	0		1.06s	73	0
MiniMax M2.5	8.0	6.8	83.3%	1		4.64s	252	1,873

Puzzle Solving	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Seed-2.0-Lite	4.0	4.4	55.6%	2		2.46s	620	0
MiniMax M2.5	4.0	7.2	44.4%	1		11.54s	159	9,547

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
Seed-2.0-Lite	10.0	10.0	100.0%	0		3.94s	292	0
MiniMax M2.5	10.0	10.0	100.0%	0		15.35s	269	937

Comparație rapidă

Schimbă perechea de comparație

MiniMax M2.5mediumvsQwen3.5-35B-A3Bnone Seed-2.0-LitenonevsGrok 4.20 Multi-Agent Betamedium MiniMax M2.5mediumvsHunter Alphanone Seed-2.0-Litenonevsgpt-oss-120bmediumDisponibil gratuit MiniMax M2.5mediumvsGPT-5.4none MiniMax M2.5mediumvsQwen3.5-27Bnone MiniMax M2.5mediumvsGrok 4.20 Betanone MiniMax M2.5mediumvsQwen3.5-122B-A10Bnone Seed-2.0-LitenonevsMercury 2medium Trinity Large PreviewnoneDisponibil gratuitvsMiniMax M2.5medium Gemini 2.5 FlashnonevsMiniMax M2.5medium MiniMax M2.5mediumvsQwen3.5-Flashnone