ナビゲーション
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mercury 2 (medium) vs Muse Glimmer 30B (low)

Muse Glimmer 30B (low) が平均スコアでリードし、7.1 vs 7.0 です。 Mercury 2 (medium) の benchmark コストが低く、$0.093 vs $0.186 です。 Mercury 2 (medium) の方が高速で、2.72s vs 18.51s です、成功率は 51.5% vs 63.6% です。

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-08-11

順位
#104
合計出力トークン
87,119
応答時間(平均)
2.72s
合計コスト
$0.093
順位
#99
合計出力トークン
95,478
応答時間(平均)
18.51s
合計コスト
$0.186
おすすめモデル Mercury 2 (medium)

スコアはここでの最高値に近く(7.0 vs 7.1)、Muse Glimmer 30B (low) より約 2.0 倍低コストです。

詳細比較

指標 Mercury 2 Mercury 2 medium リリース: 2026-02-24 Muse Glimmer 30B Muse Glimmer 30B low リリース: 2026-08-11
スコア 7.0 7.1
順位 #104 #99
信頼性 10.0 10.0
一貫性 8.8 8.2
ベンチマーク網羅率 22/22 テスト · 66/66 回 22/22 テスト · 66/66 回
正解テスト
試行ごとの合格率 51.5% 63.6%
不安定なテスト 3 5
総実行回数 66 66
結果あたりのコスト 0.928 1.685
合計コスト $0.093 $0.186
入力価格 $0.250 / 1M $0.350 / 1M
出力価格 $0.750 / 1M $1.500 / 1M
合計入力トークン 109,572 130,300
出力トークン 10,313 33,907
推論トークン 76,806 61,571
応答時間(平均) 2.72s 18.51s
応答時間(最大) 14.63s 234.92s
応答時間(合計) 57.12s 407.22s

モデル生成ショーケース

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#104 Mercury 2

medium
コスト
$0.002
時間
2.1s
トークン
1,702 tok

#99 Muse Glimmer 30B

low
コスト
$0.002
時間
13.5s
トークン
953 tok

スコア上位モデル

スコア vs 総コスト

応答時間(平均)

スコア vs 応答時間(平均)

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

コーディング スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
Muse Glimmer 30B 8.1 9.9 66.7% 0 16.52s 7,419 2,759 10,173

クイック比較

比較ペアを切り替え