AI BENCHY Compare

Anthropic: Claude Opus 4.6 vs OpenAI: GPT-5.5

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-04-24

指標	Claude Opus 4.6 Claude Opus 4.6 medium リリース: 2026-02-05	GPT-5.5 GPT-5.5 none リリース: 2026-04-24

指標	Claude Opus 4.6 Claude Opus 4.6 medium リリース: 2026-02-05	GPT-5.5 GPT-5.5 none リリース: 2026-04-24
スコア	7.6	6.8
順位	#45	#58
信頼性	該当なし	該当なし
一貫性	9.1	8.3
正解テスト
試行ごとの合格率	70.4%	61.1%
不安定なテスト	2	4
総実行回数	54	54
結果あたりのコスト	12.047	2.162
合計コスト	$1.446	$0.195
????	$5.000 / 1M	$5.000 / 1M
????	$25.000 / 1M	$30.000 / 1M
出力トークン	29,829	1,910
推論トークン	18,938	0
応答時間（平均）	21.08s	1.83s
応答時間（最大）	83.40s	5.56s
応答時間（合計）	231.84s	32.86s

スコア上位モデル

スコア vs 総コスト

応答時間（平均）

スコア vs 応答時間（平均）

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

反AIトリック	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Claude Opus 4.6	6.4	5.8	66.7%	2		7.45s	986	1,071
GPT-5.5	6.9	7.9	66.7%	1		1.31s	213	0

コーディング	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Claude Opus 4.6	10.0	10.0	100.0%	0		23.11s	3,486	1,504
GPT-5.5	10.0	10.0	100.0%	0		2.05s	426	0

複合	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Claude Opus 4.6	10.0	10.0	100.0%	0		76.66s	8,178	5,194
GPT-5.5	3.0	10.0	0.0%	0		5.56s	300	0

データ解析と抽出	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Claude Opus 4.6	10.0	10.0	100.0%	0		7.37s	691	757
GPT-5.5	10.0	10.0	100.0%	0		1.18s	222	0

ドメイン特化	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Claude Opus 4.6	3.0	10.0	0.0%	0		83.40s	14,642	8,687
GPT-5.5	2.9	7.2	11.1%	1		1.31s	52	0

汎用知能	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Claude Opus 4.6	10.0	10.0	100.0%	0		5.04s	188	292
GPT-5.5	10.0	10.0	100.0%	0		3.41s	124	0

指示追従	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Claude Opus 4.6	10.0	10.0	100.0%	0		2.43s	266	467
GPT-5.5	6.2	5.8	66.7%	1		1.15s	81	0

パズル解決	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Claude Opus 4.6	7.7	10.0	66.7%	0		4.60s	531	637
GPT-5.5	6.7	7.9	55.6%	1		1.36s	245	0

ツール呼び出し	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Claude Opus 4.6	10.0	10.0	100.0%	0		9.73s	861	329
GPT-5.5	10.0	10.0	100.0%	0		3.90s	247	0

クイック比較

比較ペアを切り替え

Claude Opus 4.6mediumvsGPT-5.3 Chatnone Nemotron 3 Supermedium無料で利用可能vsGPT-5.5none GPT-5.5nonevsGrok 4.1 Fastmedium Claude Opus 4.6mediumvsDeepSeek V4 Flashhigh GPT-5.5nonevsGrok 4.20medium Kimi K2.5mediumvsGPT-5.5none Mercury 2mediumvsGPT-5.5none Claude Opus 4.6mediumvsGemini 3.1 Flash Lite Previewnone Claude Opus 4.6mediumvsGPT-5.2 Chatnone Claude Opus 4.6mediumvsGemini 3.1 Flash Lite Previewlow Claude Opus 4.6mediumvsGemini 3 Flash Previewnone Claude Opus 4.6mediumvsHY3 Previewlow無料で利用可能