ナビゲーション
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Nemotron 3 Ultra 550b A55b vs Grok 4.20 Beta

概要

Nemotron 3 Ultra 550b A55b vs Grok 4.20 Beta の benchmark 比較: Grok 4.20 Beta が平均スコアでリードし、8.5 vs 7.5 です。 Nemotron 3 Ultra 550b A55b の benchmark コストが低く、$0.177 vs $0.750 です。 Grok 4.20 Beta の方が高速で、9.75s vs 15.05s です、成功率は 69.8% vs 81.5% です。

おすすめモデル: Nemotron 3 Ultra 550b A55b - 総合的に最も良い選択です。競争力のあるスコア(7.5)、Grok 4.20 Beta より低いコスト、バランスの取れた応答時間があります。

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-06-10

指標 Nemotron 3 Ultra 550b A55b Nemotron 3 Ultra 550b A55b medium リリース: 2026-06-04 無料で利用可能 Grok 4.20 Beta Grok 4.20 Beta medium リリース: 2026-03-12
スコア 7.5 8.5
順位 #42 #14
信頼性 9.7 該当なし
一貫性 8.8 9.5
正解テスト
試行ごとの合格率 69.8% 81.5%
不安定なテスト 3 1
総実行回数 63 52
結果あたりのコスト 0.000 4.505
合計コスト $0.177 $0.750
入力価格 $0.500 / 1M $5.805 / 1M
出力価格 $2.500 / 1M $5.805 / 1M
合計入力トークン 46,813 35,955
出力トークン 18,002 1,647
推論トークン 53,091 91,565
応答時間(平均) 15.05s 9.75s
応答時間(最大) 43.93s 31.36s
応答時間(合計) 316.09s 175.48s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#42 Nemotron 3 Ultra 550b A55b

medium
No showcase result has been generated for this model yet.
Cost
$0.000
Time
-
Tokens
0 tok

#14 Grok 4.20 Beta

medium
Cost
$0.034
Time
91.0s
Tokens
13,523 tok

スコア上位モデル

スコア vs 総コスト

応答時間(平均)

スコア vs 応答時間(平均)

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

反AIトリック スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Nemotron 3 Ultra 550b A55b 10.0 10.0 100.0% 0 8.62s 780 835 1,485
Grok 4.20 Beta 8.7 7.9 91.7% 1 3.16s 2,010 268 7,583
コーディング スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Nemotron 3 Ultra 550b A55b 8.4 7.4 88.9% 1 26.53s 7,686 2,854 17,725
Grok 4.20 Beta 10.0 10.0 100.0% 0 31.36s 360 81 3,987
複合 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Nemotron 3 Ultra 550b A55b 9.8 10.0 100.0% 0 43.93s 17,574 1,040 3,590
Grok 4.20 Beta 10.0 10.0 100.0% 0 20.93s 12,909 227 12,212
データ解析と抽出 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Nemotron 3 Ultra 550b A55b 10.0 10.0 100.0% 0 5.68s 7,989 473 1,285
Grok 4.20 Beta 10.0 10.0 100.0% 0 4.01s 7,761 180 5,281
ドメイン特化 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Nemotron 3 Ultra 550b A55b 3.5 4.4 33.3% 2 24.90s 858 11,169 16,249
Grok 4.20 Beta 5.3 10.0 33.3% 0 21.33s 1,764 251 40,255
汎用知能 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Nemotron 3 Ultra 550b A55b 3.7 9.5 0.0% 0 2.52s 360 70 235
Grok 4.20 Beta 10.0 10.0 100.0% 0 5.78s 825 72 3,440
指示追従 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Nemotron 3 Ultra 550b A55b 9.8 10.0 100.0% 0 6.35s 765 182 1,243
Grok 4.20 Beta 9.8 10.0 100.0% 0 4.89s 1,362 57 7,123
パズル解決 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Nemotron 3 Ultra 550b A55b 5.5 9.9 33.3% 0 3.54s 792 771 2,055
Grok 4.20 Beta 10.0 10.0 100.0% 0 3.52s 1,689 328 6,300
ツール呼び出し スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Nemotron 3 Ultra 550b A55b 10.0 10.0 100.0% 0 7.72s 9,781 304 984
Grok 4.20 Beta 3.0 10.0 0.0% 0 12.39s 7,275 183 5,384
雑学 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Nemotron 3 Ultra 550b A55b 3.0 10.0 0.0% 0 38.47s 228 304 8,240
Grok 4.20 Beta - - - - - - - - -

クイック比較

比較ペアを切り替え