ナビゲーション
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

OpenAI: GPT-5.3 Chat vs xAI: Grok Build 0.1

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-05-21

指標 GPT-5.3 Chat GPT-5.3 Chat none リリース: 2026-03-03 Grok Build 0.1 Grok Build 0.1 medium リリース: 2026-05-21
スコア 7.6 7.8
順位 #52 #41
信頼性 10.0 10.0
一貫性 8.7 8.9
正解テスト
試行ごとの合格率 70.2% 71.9%
不安定なテスト 3 3
総実行回数 57 57
結果あたりのコスト 2.895 4.064
合計コスト $0.348 $0.488
???? $1.750 / 1M $1.000 / 1M
???? $14.000 / 1M $2.000 / 1M
出力トークン 21,353 1,947
推論トークン 0 223,372
応答時間(平均) 5.80s 22.28s
応答時間(最大) 18.33s 88.28s
応答時間(合計) 110.27s 423.30s

スコア上位モデル

スコア vs 総コスト

応答時間(平均)

スコア vs 応答時間(平均)

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

反AIトリック スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
GPT-5.3 Chat 6.7 8.1 58.3% 1 3.86s 3,167 0
Grok Build 0.1 10.0 10.0 100.0% 0 5.46s 195 9,825
コーディング スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
GPT-5.3 Chat 10.0 10.0 100.0% 0 9.32s 1,436 0
Grok Build 0.1 7.3 3.7 66.7% 1 30.98s 354 17,734
複合 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
GPT-5.3 Chat 10.0 10.0 100.0% 0 11.96s 2,614 0
Grok Build 0.1 10.0 10.0 100.0% 0 30.81s 231 18,779
データ解析と抽出 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
GPT-5.3 Chat 10.0 10.0 100.0% 0 2.21s 942 0
Grok Build 0.1 10.0 10.0 100.0% 0 7.76s 180 10,343
ドメイン特化 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
GPT-5.3 Chat 3.5 4.4 33.3% 2 13.01s 8,264 0
Grok Build 0.1 5.3 10.0 33.3% 0 77.75s 501 111,807
汎用知能 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
GPT-5.3 Chat 4.6 10.0 0.0% 0 1.99s 319 0
Grok Build 0.1 3.8 2.5 33.3% 1 10.14s 78 5,386
指示追従 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
GPT-5.3 Chat 9.8 10.0 100.0% 0 3.29s 1,455 0
Grok Build 0.1 9.8 10.0 100.0% 0 9.62s 57 12,436
パズル解決 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
GPT-5.3 Chat 10.0 10.0 100.0% 0 2.93s 1,726 0
Grok Build 0.1 6.2 7.5 55.6% 1 8.67s 161 15,476
ツール呼び出し スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
GPT-5.3 Chat 10.0 10.0 100.0% 0 8.36s 861 0
Grok Build 0.1 10.0 10.0 100.0% 0 9.40s 180 5,319
雑学 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
GPT-5.3 Chat 3.0 10.0 0.0% 0 4.38s 569 0
Grok Build 0.1 3.0 10.0 0.0% 0 26.07s 10 16,267

クイック比較

比較ペアを切り替え