AI BENCHY Compare

DeepSeek: DeepSeek V4 Pro vs Google: Gemini 3 Flash Preview

概要

DeepSeek V4 Pro vs Gemini 3 Flash Preview の benchmark 比較: Gemini 3 Flash Preview が平均スコアでリードし、7.4 vs 7.2 です。 DeepSeek V4 Pro の benchmark コストが低く、$0.034 vs $0.111 です。 Gemini 3 Flash Preview の方が高速で、5.76s vs 6.41s です、成功率は 52.4% vs 79.4% です。

おすすめモデル: Gemini 3 Flash Preview - この比較で最も高いスコア（7.4）を出し、全 2 モデルの中でコストと応答時間のバランスも最良です。

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-06-18

指標	DeepSeek V4 Pro DeepSeek V4 Pro none リリース: 2026-04-24	Gemini 3 Flash Preview Gemini 3 Flash Preview low リリース: 2025-12-17

指標	DeepSeek V4 Pro DeepSeek V4 Pro none リリース: 2026-04-24	Gemini 3 Flash Preview Gemini 3 Flash Preview low リリース: 2025-12-17
スコア	7.2	7.4
順位	#58	#52
信頼性	9.9	10.0
一貫性	8.8	9.2
正解テスト
試行ごとの合格率	52.4%	79.4%
不安定なテスト	3	2
総実行回数	63	63
結果あたりのコスト	0.333	0.689
合計コスト	$0.034	$0.111
入力価格	$0.435 / 1M	$0.500 / 1M
出力価格	$0.870 / 1M	$3.000 / 1M
合計入力トークン	53,558	36,769
出力トークン	11,424	2,076
推論トークン	0	28,518
応答時間（平均）	6.41s	5.76s
応答時間（最大）	30.09s	14.72s
応答時間（合計）	134.66s	120.93s

生成ショーケース

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#58 DeepSeek V4 Pro

none

無効なSVG

コスト: $0.000
時間: 300.0s
トークン: 0 tok

#52 Gemini 3 Flash Preview

low

コスト: $0.007
時間: 12.1s
トークン: 2,289 tok

スコア上位モデル

スコア vs 総コスト

応答時間（平均）

スコア vs 応答時間（平均）

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

反AIトリック	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
DeepSeek V4 Pro	3.2	6.1	16.7%	2		4.02s	540	1,168	0
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		3.48s	500	281	3,082

コーディング	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
DeepSeek V4 Pro	5.6	10.0	33.3%	0		13.38s	7,275	5,500	0
Gemini 3 Flash Preview	5.8	7.2	44.4%	1		6.00s	8,122	456	7,421

複合	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
DeepSeek V4 Pro	9.5	10.0	100.0%	0		23.74s	27,529	2,235	0
Gemini 3 Flash Preview	3.0	10.0	0.0%	0		3.27s	12,860	326	0

データ解析と抽出	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
DeepSeek V4 Pro	10.0	10.0	100.0%	0		4.61s	7,568	200	0
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		9.40s	7,261	279	3,656

ドメイン特化	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
DeepSeek V4 Pro	5.3	10.0	33.3%	0		3.72s	666	24	0
Gemini 3 Flash Preview	5.3	7.2	44.4%	1		8.05s	645	12	6,410

汎用知能	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
DeepSeek V4 Pro	5.0	10.0	0.0%	0		2.05s	471	126	0
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		3.68s	492	120	981

指示追従	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
DeepSeek V4 Pro	6.3	5.8	66.7%	1		4.12s	627	713	0
Gemini 3 Flash Preview	9.9	10.0	100.0%	0		7.02s	621	71	2,752

パズル解決	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
DeepSeek V4 Pro	10.0	10.0	100.0%	0		3.61s	594	442	0
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		5.77s	562	288	3,168

ツール呼び出し	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
DeepSeek V4 Pro	10.0	10.0	100.0%	0		7.40s	8,105	328	0
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		4.99s	5,550	234	415

雑学	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
DeepSeek V4 Pro	3.0	10.0	0.0%	0		5.76s	183	688	0
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		2.75s	156	9	633

クイック比較

比較ペアを切り替え