ナビゲーション
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Opus 4.8 vs Xiaomi: MiMo-V2.5-Pro

Claude Opus 4.8 が平均スコアでリードし、7.3 vs 6.9 です。 MiMo-V2.5-Pro (medium) の benchmark コストが低く、$0.187 vs $1.166 です。 Claude Opus 4.8 の方が高速で、4.91s vs 33.92s です、成功率は 63.6% vs 66.7% です。

おすすめモデルClaude Opus 4.8ここでは最高スコア(7.3)で、MiMo-V2.5-Pro (medium) より約 6.9 倍速く応答します。

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-07-25

指標 Claude Opus 4.8 Claude Opus 4.8 none リリース: 2026-05-28 MiMo-V2.5-Pro MiMo-V2.5-Pro medium リリース: 2026-04-22
スコア 7.3 6.9
順位 #74 #92
信頼性 10.0 10.0
一貫性 9.2 8.2
正解テスト
試行ごとの合格率 63.6% 66.7%
不安定なテスト 2 5
総実行回数 66 66
結果あたりのコスト 8.969 3.218
合計コスト $1.166 $0.187
入力価格 $5.000 / 1M $0.435 / 1M
出力価格 $25.000 / 1M $0.870 / 1M
合計入力トークン 149,206 139,883
出力トークン 16,797 15,521
推論トークン 0 130,992
応答時間(平均) 4.91s 33.92s
応答時間(最大) 35.03s 197.54s
応答時間(合計) 108.03s 746.19s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#74 Claude Opus 4.8

none
コスト
$0.053
時間
22.0s
トークン
2,253 tok

#92 MiMo-V2.5-Pro

medium
無効なSVG
コスト
$0.000
時間
300.0s
トークン
0 tok

スコア上位モデル

スコア vs 総コスト

応答時間(平均)

スコア vs 応答時間(平均)

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

コーディング スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Claude Opus 4.8 5.5 10.0 33.3% 0 3.29s 10,590 1,332 0
MiMo-V2.5-Pro 6.2 4.7 66.7% 2 92.07s 6,543 780 51,218

クイック比較

比較ペアを切り替え