ナビゲーション
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

比較対象モデル

GPT-5.4 (medium) vs GPT-5.3-Codex (medium) vs GPT-5.2 (medium) ベンチマーク比較: GPT-5.3-Codex (medium) は スコア で 8.9 と首位です。 GPT-5.4 (medium) は 信頼性 で 10.0 と首位です。 GPT-5.3-Codex (medium) は 合計コスト が最も低く、$0.920 です。 GPT-5.3-Codex (medium)16.96s で最速です。

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-08-07

順位
#29
合計出力トークン
88,670
応答時間(平均)
23.10s
合計コスト
$1.533
順位
#18
合計出力トークン
55,525
応答時間(平均)
16.96s
合計コスト
$0.920
順位
#33
合計出力トークン
54,782
応答時間(平均)
22.62s
合計コスト
$0.951
おすすめモデル GPT-5.3-Codex (medium)

この比較で最も高いスコア(8.9)を出し、全 3 モデルの中でコストと応答時間のバランスも最良です。

詳細比較

指標 GPT-5.4 GPT-5.4 medium リリース: 2026-03-05 GPT-5.3-Codex GPT-5.3-Codex medium リリース: 2026-02-05 GPT-5.2 GPT-5.2 medium リリース: 2025-12-11
スコア 8.5 8.9 8.4
順位 #29 #18 #33
信頼性 10.0 10.0 10.0
一貫性 8.6 8.6 8.5
ベンチマーク網羅率 22/22 テスト · 66/66 回 22/22 テスト · 66/66 回 22/22 テスト · 66/66 回
正解テスト
試行ごとの合格率 77.3% 83.3% 72.7%
不安定なテスト 4 4 4
総実行回数 66 66 66
結果あたりのコスト 10.220 5.748 6.791
合計コスト $1.533 $0.920 $0.951
入力価格 $2.500 / 1M $1.750 / 1M $1.750 / 1M
出力価格 $15.000 / 1M $14.000 / 1M $14.000 / 1M
合計入力トークン 81,127 81,268 105,004
出力トークン 6,155 6,251 9,914
推論トークン 82,515 49,274 44,868
応答時間(平均) 23.10s 16.96s 22.62s
応答時間(最大) 100.41s 100.93s 102.93s
応答時間(合計) 508.26s 373.19s 339.28s

モデル生成ショーケース

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#29 GPT-5.4

medium
コスト
$0.214
時間
199.6s
トークン
14,349 tok

#18 GPT-5.3-Codex

medium
コスト
$0.049
時間
54.9s
トークン
3,580 tok

#33 GPT-5.2

medium
コスト
$0.047
時間
49.2s
トークン
3,396 tok

スコア上位モデル

スコア vs 総コスト

応答時間(平均)

スコア vs 応答時間(平均)

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

コーディング スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
GPT-5.2 10.0 10.0 100.0% 0 22.73s 7,302 511 11,912

クイック比較

比較ペアを切り替え