ナビゲーション
Advertise here

比較対象モデル

GPT-5.4 (medium) vs GPT-5.3-Codex (medium) vs GPT-5.2 (medium) ベンチマーク比較: GPT-5.3-Codex (medium) は スコア で 8.9 と首位です。 GPT-5.4 (medium) は 信頼性 で 10.0 と首位です。 GPT-5.3-Codex (medium) は 合計コスト が最も低く、$0.988 です。 GPT-5.3-Codex (medium) は 16.91s で最速です。

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-09-24

比較対象モデル

順位
#56
合計出力トークン
90,466
応答時間(平均)
22.85s
合計コスト
$1.560
順位
#37
合計出力トークン
60,374
応答時間(平均)
16.91s
合計コスト
$0.988
順位
#64
合計出力トークン
71,252
応答時間(平均)
28.51s
合計コスト
$1.182
おすすめモデル GPT-5.3-Codex (medium)

ここでは最高スコア(8.9)で、この比較の他のモデル より約 1.5 倍速く応答します。

詳細比較

指標 GPT-5.4 GPT-5.4 medium リリース: 2026-03-05 GPT-5.3-Codex GPT-5.3-Codex medium リリース: 2026-02-05 GPT-5.2 GPT-5.2 medium リリース: 2025-12-11
スコア 8.5 8.9 8.4
順位 #56 #37 #64
信頼性 10.0 10.0 10.0
一貫性 8.6 8.6 8.5
試行回数 66/66 66/66 66/66
正解テスト
試行ごとの合格率 77.3% 83.3% 72.7%
不安定なテスト 4 4 4
総実行回数 66 66 66
結果あたりのコスト 10.399 6.171 8.438
合計コスト $1.560 $0.988 $1.182
入力価格 $2.500 / 1M $1.750 / 1M $1.750 / 1M
出力価格 $15.000 / 1M $14.000 / 1M $14.000 / 1M
合計入力トークン 81,136 81,187 105,013
出力トークン 6,155 6,258 9,914
推論トークン 84,311 54,116 61,338
応答時間(平均) 22.85s 16.91s 28.51s
応答時間(最大) 100.41s 100.93s 116.86s
応答時間(合計) 502.78s 372.03s 456.13s
パラメータ ~1.5T 総数 (~100B アクティブ) ~1.2T 総数 (~80B アクティブ) ~1.2T 総数 (~80B アクティブ)
公開状況 クローズド クローズド クローズド

モデル生成ショーケース

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#56 GPT-5.4

medium
コスト
$0.214
時間
199.6s
トークン
14,349 tok

#37 GPT-5.3-Codex

medium
コスト
$0.049
時間
54.9s
トークン
3,580 tok

#64 GPT-5.2

medium
コスト
$0.047
時間
49.2s
トークン
3,396 tok

スコア上位モデル

スコア vs 総コスト

応答時間(平均)

スコア vs 応答時間(平均)

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

コーディング スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
GPT-5.2 10.0 10.0 100.0% 0 22.73s 7,302 511 11,912

クイック比較

比較ペアを切り替え