AI BENCHY Compare

Nemotron 3 Ultra 550b A55b vs Grok 4.20 Multi Agent Beta

概要

Nemotron 3 Ultra 550b A55b vs Grok 4.20 Multi Agent Beta の benchmark 比較: Nemotron 3 Ultra 550b A55b が平均スコアでリードし、7.5 vs 6.6 です。 Nemotron 3 Ultra 550b A55b の benchmark コストが低く、$0.177 vs $5.599 です。 Grok 4.20 Multi Agent Beta の方が高速で、9.69s vs 15.05s です、成功率は 69.8% vs 59.3% です。

おすすめモデル: Nemotron 3 Ultra 550b A55b - ここでは最高スコア（7.5）で、Grok 4.20 Multi Agent Beta より約 31.8 倍低コストです。

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-06-10

指標	Nemotron 3 Ultra 550b A55b Nemotron 3 Ultra 550b A55b medium リリース: 2026-06-04 無料で利用可能	Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium リリース: 2026-03-12

指標	Nemotron 3 Ultra 550b A55b Nemotron 3 Ultra 550b A55b medium リリース: 2026-06-04 無料で利用可能	Grok 4.20 Multi Agent Beta Grok 4.20 Multi Agent Beta medium リリース: 2026-03-12
スコア	7.5	6.6
順位	#42	#85
信頼性	9.7	該当なし
一貫性	8.8	7.9
正解テスト
試行ごとの合格率	69.8%	59.3%
不安定なテスト	3	5
総実行回数	63	52
結果あたりのコスト	0.000	62.923
合計コスト	$0.177	$5.599
入力価格	$0.500 / 1M	$4.235 / 1M
出力価格	$2.500 / 1M	$4.235 / 1M
合計入力トークン	46,813	721,952
出力トークン	18,002	294,668
推論トークン	53,091	305,374
応答時間（平均）	15.05s	9.69s
応答時間（最大）	43.93s	35.28s
応答時間（合計）	316.09s	155.07s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#42 Nemotron 3 Ultra 550b A55b

medium

No showcase result has been generated for this model yet.

Cost: $0.000
Time: -
Tokens: 0 tok

#85 Grok 4.20 Multi Agent Beta

medium

Cost: $0.261
Time: 123.4s
Tokens: 199,344 tok

スコア上位モデル

スコア vs 総コスト

応答時間（平均）

スコア vs 応答時間（平均）

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

反AIトリック	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Nemotron 3 Ultra 550b A55b	10.0	10.0	100.0%	0		8.62s	780	835	1,485
Grok 4.20 Multi Agent Beta	6.9	5.8	75.0%	2		3.46s	90,925	33,706	33,077

コーディング	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Nemotron 3 Ultra 550b A55b	8.4	7.4	88.9%	1		26.53s	7,686	2,854	17,725
Grok 4.20 Multi Agent Beta	10.0	10.0	100.0%	0		27.11s	13,212	86	13,141

複合	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Nemotron 3 Ultra 550b A55b	9.8	10.0	100.0%	0		43.93s	17,574	1,040	3,590
Grok 4.20 Multi Agent Beta	3.0	10.0	0.0%	0		0ms	0	0	0

データ解析と抽出	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Nemotron 3 Ultra 550b A55b	10.0	10.0	100.0%	0		5.68s	7,989	473	1,285
Grok 4.20 Multi Agent Beta	10.0	10.0	100.0%	0		5.54s	97,232	25,306	25,051

ドメイン特化	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Nemotron 3 Ultra 550b A55b	3.5	4.4	33.3%	2		24.90s	858	11,169	16,249
Grok 4.20 Multi Agent Beta	2.9	7.2	11.1%	1		24.67s	328,253	164,609	163,647

汎用知能	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Nemotron 3 Ultra 550b A55b	3.7	9.5	0.0%	0		2.52s	360	70	235
Grok 4.20 Multi Agent Beta	5.8	2.8	66.7%	1		6.40s	41,387	15,848	15,746

指示追従	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Nemotron 3 Ultra 550b A55b	9.8	10.0	100.0%	0		6.35s	765	182	1,243
Grok 4.20 Multi Agent Beta	9.8	10.0	100.0%	0		3.52s	43,923	19,752	19,617

パズル解決	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Nemotron 3 Ultra 550b A55b	5.5	9.9	33.3%	0		3.54s	792	771	2,055
Grok 4.20 Multi Agent Beta	6.7	7.9	55.6%	1		5.19s	107,020	35,361	35,095

ツール呼び出し	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Nemotron 3 Ultra 550b A55b	10.0	10.0	100.0%	0		7.72s	9,781	304	984
Grok 4.20 Multi Agent Beta	3.0	10.0	0.0%	0		0ms	0	0	0

雑学	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Nemotron 3 Ultra 550b A55b	3.0	10.0	0.0%	0		38.47s	228	304	8,240
Grok 4.20 Multi Agent Beta	-	-	-	-	-	-	-	-	-

クイック比較

比較ペアを切り替え