AI BENCHY Compare

Anthropic: Claude Opus 4.7 vs Google: Gemini 3 Flash Preview

概要

Claude Opus 4.7 vs Gemini 3 Flash Preview の benchmark 比較: Claude Opus 4.7 が平均スコアでリードし、7.4 vs 7.4 です。 Gemini 3 Flash Preview の benchmark コストが低く、$0.111 vs $0.505 です。 Claude Opus 4.7 の方が高速で、3.02s vs 5.76s です、成功率は 76.2% vs 79.4% です。

おすすめモデル: Gemini 3 Flash Preview - スコアはここでの最高値に近く（7.4 vs 7.4）、Claude Opus 4.7 より約 4.6 倍低コストです。

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-06-18

指標	Claude Opus 4.7 Claude Opus 4.7 none リリース: 2026-04-16	Gemini 3 Flash Preview Gemini 3 Flash Preview low リリース: 2025-12-17

指標	Claude Opus 4.7 Claude Opus 4.7 none リリース: 2026-04-16	Gemini 3 Flash Preview Gemini 3 Flash Preview low リリース: 2025-12-17
スコア	7.4	7.4
順位	#49	#52
信頼性	10.0	10.0
一貫性	9.0	9.2
正解テスト
試行ごとの合格率	76.2%	79.4%
不安定なテスト	0	2
総実行回数	57	63
結果あたりのコスト	3.154	0.689
合計コスト	$0.505	$0.111
入力価格	$5.000 / 1M	$0.500 / 1M
出力価格	$25.000 / 1M	$3.000 / 1M
合計入力トークン	69,576	36,769
出力トークン	6,265	2,076
推論トークン	0	28,518
応答時間（平均）	3.02s	5.76s
応答時間（最大）	18.27s	14.72s
応答時間（合計）	57.44s	120.93s

生成ショーケース

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#49 Claude Opus 4.7

none

コスト: $0.051
時間: 24.2s
トークン: 2,181 tok

#52 Gemini 3 Flash Preview

low

コスト: $0.007
時間: 12.1s
トークン: 2,289 tok

スコア上位モデル

スコア vs 総コスト

応答時間（平均）

スコア vs 応答時間（平均）

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

反AIトリック	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Claude Opus 4.7	8.3	10.0	75.0%	0		2.12s	894	522	0
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		3.48s	500	281	3,082

コーディング	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Claude Opus 4.7	3.3	3.3	33.3%	0		2.84s	1,176	494	0
Gemini 3 Flash Preview	5.8	7.2	44.4%	1		6.00s	8,122	456	7,421

複合	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Claude Opus 4.7	9.5	10.0	100.0%	0		18.27s	37,740	3,504	0
Gemini 3 Flash Preview	3.0	10.0	0.0%	0		3.27s	12,860	326	0

データ解析と抽出	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Claude Opus 4.7	10.0	10.0	100.0%	0		2.15s	10,533	324	0
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		9.40s	7,261	279	3,656

ドメイン特化	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Claude Opus 4.7	7.7	10.0	66.7%	0		1.19s	1,020	78	0
Gemini 3 Flash Preview	5.3	7.2	44.4%	1		8.05s	645	12	6,410

汎用知能	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Claude Opus 4.7	10.0	10.0	100.0%	0		3.47s	723	257	0
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		3.68s	492	120	981

指示追従	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Claude Opus 4.7	10.0	10.0	100.0%	0		1.46s	939	114	0
Gemini 3 Flash Preview	9.9	10.0	100.0%	0		7.02s	621	71	2,752

パズル解決	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Claude Opus 4.7	10.0	10.0	100.0%	0		2.46s	939	597	0
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		5.77s	562	288	3,168

ツール呼び出し	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Claude Opus 4.7	10.0	10.0	100.0%	0		4.74s	15,339	372	0
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		4.99s	5,550	234	415

雑学	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Claude Opus 4.7	3.0	10.0	0.0%	0		1.46s	273	3	0
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		2.75s	156	9	633

クイック比較

比較ペアを切り替え