ナビゲーション
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

比較対象モデル

GLM 5 (medium) vs GLM 5.1 (medium) vs Kimi K2.5 (medium) vs Qwen3.6 Plus Preview (medium) ベンチマーク比較: GLM 5 (medium) は スコア で 7.7 と首位です。 GLM 5 (medium) は 信頼性 で 10.0 と首位です。 Qwen3.6 Plus Preview (medium) は 合計コスト が最も低く、$0.000 です。 Qwen3.6 Plus Preview (medium)15.25s で最速です。

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-09-10

比較対象モデル

順位
#92
合計出力トークン
124,566
応答時間(平均)
33.54s
合計コスト
$0.228
順位
#142
合計出力トークン
215,889
応答時間(平均)
58.80s
合計コスト
$0.727
順位
#147
合計出力トークン
220,942
応答時間(平均)
98.19s
合計コスト
$0.479
順位
#280
合計出力トークン
63,350
応答時間(平均)
15.25s
合計コスト
$0.000
おすすめモデル GLM 5 (medium)

ここでは最高スコア(7.7)で、この比較の他のモデル より約 2.7 倍低コストです。

詳細比較

指標 GLM 5 GLM 5 medium リリース: 2026-02-12 GLM 5.1 GLM 5.1 medium リリース: 2026-04-07 Kimi K2.5 Kimi K2.5 medium リリース: 2026-01-27 Qwen3.6 Plus Preview Qwen3.6 Plus Preview medium リリース: 2026-04-20 無料で利用可能
スコア 7.7 7.0 7.0 4.9
順位 #92 #142 #147 #280
信頼性 10.0 8.1 10.0 該当なし
一貫性 8.1 8.4 7.0 8.6
試行回数 63/66 66/66 66/66 57/66
正解テスト
試行ごとの合格率 78.8% 65.2% 63.6% 40.9%
不安定なテスト 4 4 8 0
総実行回数 63 66 66 57
結果あたりのコスト 1.668 6.923 4.849 0.000
合計コスト $0.228 $0.727 $0.479 $0.000
入力価格 $0.600 / 1M $0.966 / 1M $0.450 / 1M $0.000 / 1M
出力価格 $1.920 / 1M $3.036 / 1M $2.250 / 1M $0.000 / 1M
合計入力トークン 35,224 82,592 118,496 32,639
出力トークン 21,570 16,089 53,522 1,153
推論トークン 102,996 199,800 167,420 62,197
応答時間(平均) 33.54s 58.80s 98.19s 15.25s
応答時間(最大) 99.85s 308.75s 281.00s 43.55s
応答時間(合計) 435.99s 1234.72s 1571.05s 182.96s
パラメータ 744B 総数 (40B アクティブ) 744B 総数 (40B アクティブ) 1T 総数 (32B アクティブ) ~397B 総数 (~17B アクティブ)
公開状況 オープンソース オープンソース 重み公開 クローズド

モデル生成ショーケース

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#92 GLM 5

medium
コスト
$0.005
時間
20.7s
トークン
2,068 tok

#142 GLM 5.1

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
コスト
$0.000
時間
300.0s
トークン
0 tok

#147 MoonshotAI: Kimi K2.5

medium
コスト
$0.030
時間
58.6s
トークン
8,683 tok

#280 Qwen3.6 Plus Preview

medium
このモデルのショーケース結果はまだ生成されていません。
コスト
該当なし
時間
-
トークン
0 tok

スコア上位モデル

スコア vs 総コスト

応答時間(平均)

スコア vs 応答時間(平均)

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

コーディング スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
GLM 5 10.0 10.0 100.0% 0 74.30s 7,254 2,997 52,930
GLM 5.1 4.6 3.7 44.5% 2 109.63s 5,702 4,871 37,826
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693
Qwen3.6 Plus Preview 9.8 3.3 0.0% 0 0ms 0 0 0

クイック比較

比較ペアを切り替え