AI BENCHY Compare

Nemotron 3 Ultra 550b A55b vs Grok 4.20 Beta

Rezumat

Comparație benchmark Nemotron 3 Ultra 550b A55b vs Grok 4.20 Beta: Grok 4.20 Beta conduce la scorul mediu cu 8.5 vs 7.5. Nemotron 3 Ultra 550b A55b are costul de benchmark mai mic, $0.177 vs $0.750. Grok 4.20 Beta este mai rapid cu 9.75s vs 15.05s, cu rate de reușită de 69.8% vs 81.5%.

Model recomandat: Nemotron 3 Ultra 550b A55b - Oferă cel mai bun compromis per total: scor competitiv (7.5), cost mai mic decât Grok 4.20 Beta și timp de răspuns echilibrat.

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-06-10

Metrică	Nemotron 3 Ultra 550b A55b Nemotron 3 Ultra 550b A55b medium Lansare: 2026-06-04 Disponibil gratuit	Grok 4.20 Beta Grok 4.20 Beta medium Lansare: 2026-03-12

Metrică	Nemotron 3 Ultra 550b A55b Nemotron 3 Ultra 550b A55b medium Lansare: 2026-06-04 Disponibil gratuit	Grok 4.20 Beta Grok 4.20 Beta medium Lansare: 2026-03-12
Scor	7.5	8.5
Rang	#42	#14
Fiabilitate	9.7	N/D
Consistență	8.8	9.5
Teste corecte
Rată de trecere pe încercare	69.8%	81.5%
Teste instabile	3	1
Rulări totale	63	52
Cost per rezultat	0.000	4.505
Cost total	$0.177	$0.750
Preț de intrare	$0.500 / 1M	$5.805 / 1M
Preț de ieșire	$2.500 / 1M	$5.805 / 1M
Total tokenuri de intrare	46,813	35,955
Tokenuri de ieșire	18,002	1,647
Tokenuri de raționament	53,091	91,565
Timp de răspuns (mediu)	15.05s	9.75s
Timp de răspuns (maxim)	43.93s	31.36s
Timp de răspuns (total)	316.09s	175.48s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#42 Nemotron 3 Ultra 550b A55b

medium

No showcase result has been generated for this model yet.

Cost: $0.000
Time: -
Tokens: 0 tok

#14 Grok 4.20 Beta

medium

Cost: $0.034
Time: 91.0s
Tokens: 13,523 tok

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Nemotron 3 Ultra 550b A55b	10.0	10.0	100.0%	0		8.62s	780	835	1,485
Grok 4.20 Beta	8.7	7.9	91.7%	1		3.16s	2,010	268	7,583

Programare	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Nemotron 3 Ultra 550b A55b	8.4	7.4	88.9%	1		26.53s	7,686	2,854	17,725
Grok 4.20 Beta	10.0	10.0	100.0%	0		31.36s	360	81	3,987

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Nemotron 3 Ultra 550b A55b	9.8	10.0	100.0%	0		43.93s	17,574	1,040	3,590
Grok 4.20 Beta	10.0	10.0	100.0%	0		20.93s	12,909	227	12,212

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Nemotron 3 Ultra 550b A55b	10.0	10.0	100.0%	0		5.68s	7,989	473	1,285
Grok 4.20 Beta	10.0	10.0	100.0%	0		4.01s	7,761	180	5,281

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Nemotron 3 Ultra 550b A55b	3.5	4.4	33.3%	2		24.90s	858	11,169	16,249
Grok 4.20 Beta	5.3	10.0	33.3%	0		21.33s	1,764	251	40,255

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Nemotron 3 Ultra 550b A55b	3.7	9.5	0.0%	0		2.52s	360	70	235
Grok 4.20 Beta	10.0	10.0	100.0%	0		5.78s	825	72	3,440

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Nemotron 3 Ultra 550b A55b	9.8	10.0	100.0%	0		6.35s	765	182	1,243
Grok 4.20 Beta	9.8	10.0	100.0%	0		4.89s	1,362	57	7,123

Rezolvare de puzzle-uri	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Nemotron 3 Ultra 550b A55b	5.5	9.9	33.3%	0		3.54s	792	771	2,055
Grok 4.20 Beta	10.0	10.0	100.0%	0		3.52s	1,689	328	6,300

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Nemotron 3 Ultra 550b A55b	10.0	10.0	100.0%	0		7.72s	9,781	304	984
Grok 4.20 Beta	3.0	10.0	0.0%	0		12.39s	7,275	183	5,384

Cultură generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Nemotron 3 Ultra 550b A55b	3.0	10.0	0.0%	0		38.47s	228	304	8,240
Grok 4.20 Beta	-	-	-	-	-	-	-	-	-

Comparație rapidă

Schimbă perechea de comparație