ナビゲーション
AI BENCHY
Advertise here

AI BENCHY Compare

OpenAI: GPT-5.3 Chat vs xAI: Grok 4.20

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-06-04

指標 GPT-5.3 Chat GPT-5.3 Chat none リリース: 2026-03-03 Grok 4.20 Grok 4.20 medium リリース: 2026-03-31
スコア 7.2 7.1
順位 #63 #65
信頼性 10.0 10.0
一貫性 8.1 8.8
正解テスト
試行ごとの合格率 66.7% 63.5%
不安定なテスト 5 3
総実行回数 63 63
結果あたりのコスト 3.605 8.309
合計コスト $0.433 $0.609
入力価格 $1.750 / 1M $1.250 / 1M
出力価格 $14.000 / 1M $2.500 / 1M
合計入力トークン 34,209 44,433
出力トークン 26,617 1,819
推論トークン 0 219,524
応答時間(平均) 6.34s 27.68s
応答時間(最大) 18.33s 199.66s
応答時間(合計) 133.13s 581.26s

スコア上位モデル

スコア vs 総コスト

応答時間(平均)

スコア vs 応答時間(平均)

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

反AIトリック スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
GPT-5.3 Chat 6.7 8.1 58.3% 1 3.86s 606 3,167 0
Grok 4.20 8.2 7.9 83.3% 1 3.95s 2,010 287 8,312
コーディング スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
GPT-5.3 Chat 5.6 4.7 55.6% 2 10.52s 7,302 6,632 0
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150
複合 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
GPT-5.3 Chat 10.0 10.0 100.0% 0 11.96s 11,019 2,614 0
Grok 4.20 10.0 10.0 100.0% 0 17.40s 12,909 232 9,556
データ解析と抽出 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
GPT-5.3 Chat 10.0 10.0 100.0% 0 2.21s 7,140 942 0
Grok 4.20 10.0 10.0 100.0% 0 4.17s 7,761 180 5,333
ドメイン特化 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
GPT-5.3 Chat 3.5 4.4 33.3% 2 13.01s 723 8,264 0
Grok 4.20 5.3 10.0 33.3% 0 27.03s 1,764 375 49,339
汎用知能 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
GPT-5.3 Chat 4.6 10.0 0.0% 0 1.99s 477 319 0
Grok 4.20 3.9 2.6 33.3% 1 24.48s 825 65 6,440
指示追従 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
GPT-5.3 Chat 9.8 10.0 100.0% 0 3.51s 660 1,491 0
Grok 4.20 9.8 10.0 100.0% 0 4.26s 1,362 57 6,419
パズル解決 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
GPT-5.3 Chat 10.0 10.0 100.0% 0 2.99s 642 1,758 0
Grok 4.20 7.7 10.0 66.7% 0 6.22s 1,689 149 7,913
ツール呼び出し スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
GPT-5.3 Chat 10.0 10.0 100.0% 0 8.36s 5,445 861 0
Grok 4.20 3.0 10.0 0.0% 0 13.68s 7,275 197 6,620
雑学 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
GPT-5.3 Chat 3.0 10.0 0.0% 0 4.38s 195 569 0
Grok 4.20 3.0 10.0 0.0% 0 63.48s 531 9 16,442

クイック比較

比較ペアを切り替え