ナビゲーション
AI BENCHY
Advertise here

比較対象モデル

Claude Opus 5 (high) vs GPT-5.6 Sol (high) vs Kimi K3 (max) vs Gemini 3.6 Flash (medium) ベンチマーク比較Gemini 3.6 Flash (medium) は スコア で 9.9 と首位です。 Claude Opus 5 (high) は 信頼性 で 10.0 と首位です。 Gemini 3.6 Flash (medium) は 合計コスト が最も低く、$0.831 です。 Gemini 3.6 Flash (medium)10.11s で最速です。

おすすめモデルGemini 3.6 Flash (medium)ここでは最高スコア(9.9)で、この比較の他のモデル より約 2.9 倍低コストです。

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-07-25

指標 Claude Opus 5 Claude Opus 5 high リリース: 2026-07-25 GPT-5.6 Sol GPT-5.6 Sol high リリース: 2026-07-09 Kimi K3 Kimi K3 max リリース: 2026-07-16 Gemini 3.6 Flash Gemini 3.6 Flash medium リリース: 2026-07-21
スコア 9.2 9.4 8.0 9.9
順位 #11 #8 #40 #1
信頼性 10.0 10.0 9.1 10.0
一貫性 9.6 8.9 9.5 9.6
正解テスト
試行ごとの合格率 84.9% 89.4% 75.8% 98.5%
不安定なテスト 1 3 1 1
総実行回数 66 66 66 66
結果あたりのコスト 15.747 6.852 19.446 3.955
合計コスト $2.835 $1.234 $3.112 $0.831
入力価格 $5.000 / 1M $5.000 / 1M $3.000 / 1M $1.500 / 1M
出力価格 $25.000 / 1M $30.000 / 1M $15.000 / 1M $7.500 / 1M
合計入力トークン 135,959 79,249 34,916 66,293
出力トークン 67,066 4,855 2,910 2,000
推論トークン 19,114 23,044 197,529 95,464
応答時間(平均) 20.44s 11.73s 122.48s 10.11s
応答時間(最大) 159.01s 54.79s 766.58s 68.03s
応答時間(合計) 449.68s 257.99s 2327.06s 222.33s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#11 Claude Opus 5

high
コスト
$0.265
時間
144.5s
トークン
10,741 tok

#8 GPT-5.6 Sol

high
コスト
$0.151
時間
201.9s
トークン
5,100 tok

#40 MoonshotAI: Kimi K3

max
コスト
$0.281
時間
506.9s
トークン
18,863 tok

#1 Gemini 3.6 Flash

medium
コスト
$0.079
時間
47.9s
トークン
10,532 tok

スコア上位モデル

スコア vs 総コスト

応答時間(平均)

スコア vs 応答時間(平均)

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

コーディング スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Claude Opus 5 10.0 10.0 100.0% 0 12.73s 10,590 7,547 1,721
GPT-5.6 Sol 10.0 10.0 100.0% 0 12.52s 7,302 404 5,656
Kimi K3 10.0 10.0 100.0% 0 325.79s 8,061 460 84,012
Gemini 3.6 Flash 10.0 10.0 100.0% 0 17.49s 8,136 474 40,157

クイック比較

比較ペアを切り替え