ナビゲーション
AI BENCHY
Advertise here

AI BENCHY Compare

xAI: Grok 4.20 vs Xiaomi: MiMo-V2.5

概要

Grok 4.20 vs MiMo-V2.5 の benchmark 比較: Grok 4.20 が平均スコアでリードし、7.3 vs 6.7 です。 MiMo-V2.5 の benchmark コストが低く、$0.063 vs $0.609 です。 MiMo-V2.5 の方が高速で、27.11s vs 27.68s です、成功率は 63.5% vs 69.8% です。

おすすめモデル: MiMo-V2.5 - スコアはここでの最高値に近く(6.7 vs 7.3)、Grok 4.20 より約 9.8 倍低コストです。

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-06-18

指標 Grok 4.20 Grok 4.20 medium リリース: 2026-03-31 MiMo-V2.5 MiMo-V2.5 medium リリース: 2026-04-22
スコア 7.3 6.7
順位 #53 #76
信頼性 10.0 10.0
一貫性 8.8 8.1
正解テスト
試行ごとの合格率 63.5% 69.8%
不安定なテスト 3 5
総実行回数 63 63
結果あたりのコスト 8.309 2.966
合計コスト $0.609 $0.063
入力価格 $1.250 / 1M $0.140 / 1M
出力価格 $2.500 / 1M $0.280 / 1M
合計入力トークン 44,433 41,838
出力トークン 1,819 2,827
推論トークン 219,524 198,898
応答時間(平均) 27.68s 27.11s
応答時間(最大) 199.66s 162.44s
応答時間(合計) 581.26s 569.38s

生成ショーケース

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#53 xAI: Grok 4.20

medium
コスト
$0.041
時間
110.3s
トークン
16,336 tok

#76 MiMo-V2.5

medium
コスト
$0.002
時間
54.8s
トークン
5,247 tok

スコア上位モデル

スコア vs 総コスト

応答時間(平均)

スコア vs 応答時間(平均)

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

反AIトリック スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Grok 4.20 8.2 7.9 83.3% 1 3.95s 2,010 287 8,312
MiMo-V2.5 10.0 10.0 100.0% 0 4.14s 621 281 1,739
コーディング スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150
MiMo-V2.5 6.2 4.7 66.7% 2 97.14s 7,422 557 81,977
複合 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Grok 4.20 10.0 10.0 100.0% 0 17.40s 12,909 232 9,556
MiMo-V2.5 10.0 10.0 100.0% 0 16.86s 15,060 363 7,609
データ解析と抽出 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Grok 4.20 10.0 10.0 100.0% 0 4.17s 7,761 180 5,333
MiMo-V2.5 2.7 5.7 16.7% 1 6.33s 7,746 306 5,714
ドメイン特化 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Grok 4.20 5.3 10.0 33.3% 0 27.03s 1,764 375 49,339
MiMo-V2.5 5.3 10.0 33.3% 0 34.53s 735 507 49,478
汎用知能 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Grok 4.20 3.9 2.6 33.3% 1 24.48s 825 65 6,440
MiMo-V2.5 5.4 2.5 66.7% 1 5.37s 492 121 418
指示追従 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Grok 4.20 9.8 10.0 100.0% 0 4.26s 1,362 57 6,419
MiMo-V2.5 9.9 10.0 100.0% 0 1.80s 672 88 801
パズル解決 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Grok 4.20 7.7 10.0 66.7% 0 6.22s 1,689 149 7,913
MiMo-V2.5 8.2 7.2 88.9% 1 20.25s 660 279 33,254
ツール呼び出し スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Grok 4.20 3.0 10.0 0.0% 0 13.68s 7,275 197 6,620
MiMo-V2.5 10.0 10.0 100.0% 0 7.29s 8,220 303 2,424
雑学 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Grok 4.20 3.0 10.0 0.0% 0 63.48s 531 9 16,442
MiMo-V2.5 3.0 10.0 0.0% 0 51.29s 210 22 15,484

クイック比較

比較ペアを切り替え