ナビゲーション
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.5

概要

Claude Opus 4.8 vs GPT-5.5 の benchmark 比較: GPT-5.5 が平均スコアでリードし、9.0 vs 7.2 です。 Claude Opus 4.8 の benchmark コストが低く、$0.539 vs $3.679 です。 Claude Opus 4.8 の方が高速で、3.47s vs 37.98s です、成功率は 61.9% vs 87.3% です。

おすすめモデル: Claude Opus 4.8 - 総合的に最も良い選択です。競争力のあるスコア(7.2)、GPT-5.5 より低いコスト、バランスの取れた応答時間があります。

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-06-18

指標 Claude Opus 4.8 Claude Opus 4.8 none リリース: 2026-05-28 GPT-5.5 GPT-5.5 medium リリース: 2026-04-24
スコア 7.2 9.0
順位 #57 #9
信頼性 10.0 10.0
一貫性 9.2 8.9
正解テスト
試行ごとの合格率 61.9% 87.3%
不安定なテスト 2 3
総実行回数 63 63
結果あたりのコスト 4.485 21.638
合計コスト $0.539 $3.679
入力価格 $5.000 / 1M $5.000 / 1M
出力価格 $25.000 / 1M $30.000 / 1M
合計入力トークン 67,104 34,212
出力トークン 8,107 1,985
推論トークン 0 114,925
応答時間(平均) 3.47s 37.98s
応答時間(最大) 17.73s 332.10s
応答時間(合計) 72.90s 797.60s

生成ショーケース

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#57 Claude Opus 4.8

none
コスト
$0.053
時間
22.0s
トークン
2,253 tok

#9 GPT-5.5

medium
コスト
$0.112
時間
71.9s
トークン
3,807 tok

スコア上位モデル

スコア vs 総コスト

応答時間(平均)

スコア vs 応答時間(平均)

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

反AIトリック スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Claude Opus 4.8 6.5 10.0 50.0% 0 3.40s 834 1,472 0
GPT-5.5 10.0 10.0 100.0% 0 4.66s 606 250 1,335
コーディング スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Claude Opus 4.8 5.5 10.0 33.3% 0 3.29s 10,590 1,332 0
GPT-5.5 8.8 7.8 88.9% 1 59.77s 7,305 362 24,959
複合 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Claude Opus 4.8 9.5 10.0 100.0% 0 17.73s 29,658 3,259 0
GPT-5.5 10.0 10.0 100.0% 0 19.29s 11,019 312 2,841
データ解析と抽出 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Claude Opus 4.8 7.3 5.8 83.3% 1 1.77s 10,503 308 0
GPT-5.5 10.0 10.0 100.0% 0 4.18s 7,140 234 593
ドメイン特化 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Claude Opus 4.8 5.3 7.2 44.4% 1 1.66s 975 61 0
GPT-5.5 5.3 7.2 44.4% 1 164.14s 723 67 79,625
汎用知能 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Claude Opus 4.8 10.0 10.0 100.0% 0 3.48s 708 230 0
GPT-5.5 10.0 10.0 100.0% 0 4.16s 477 138 223
指示追従 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Claude Opus 4.8 9.9 10.0 100.0% 0 1.37s 909 95 0
GPT-5.5 10.0 10.0 100.0% 0 3.36s 660 93 538
パズル解決 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Claude Opus 4.8 7.7 10.0 66.7% 0 2.74s 894 783 0
GPT-5.5 10.0 10.0 100.0% 0 6.76s 642 241 2,225
ツール呼び出し スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Claude Opus 4.8 10.0 10.0 100.0% 0 5.35s 11,775 355 0
GPT-5.5 10.0 10.0 100.0% 0 10.57s 5,445 258 832
雑学 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Claude Opus 4.8 3.0 10.0 0.0% 0 3.41s 258 212 0
GPT-5.5 2.8 1.6 33.3% 1 37.86s 195 30 1,754

クイック比較

比較ペアを切り替え