AI BENCHY Compare

Google: Gemini 3.5 Flash vs xAI: Grok 4.20

概要

Gemini 3.5 Flash vs Grok 4.20 の benchmark 比較: Grok 4.20 が平均スコアでリードし、7.3 vs 7.0 です。 Grok 4.20 の benchmark コストが低く、$0.609 vs $1.079 です。 Gemini 3.5 Flash の方が高速で、9.93s vs 27.68s です、成功率は 77.8% vs 63.5% です。

おすすめモデル: Grok 4.20 - ここでは最高スコア（7.3）で、Gemini 3.5 Flash より約 1.8 倍低コストです。

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-06-18

指標	Gemini 3.5 Flash Gemini 3.5 Flash none リリース: 2026-05-19	Grok 4.20 Grok 4.20 medium リリース: 2026-03-31

指標	Gemini 3.5 Flash Gemini 3.5 Flash none リリース: 2026-05-19	Grok 4.20 Grok 4.20 medium リリース: 2026-03-31
スコア	7.0	7.3
順位	#66	#53
信頼性	10.0	10.0
一貫性	8.9	8.8
正解テスト
試行ごとの合格率	77.8%	63.5%
不安定なテスト	3	3
総実行回数	63	63
結果あたりのコスト	7.190	8.309
合計コスト	$1.079	$0.609
入力価格	$1.500 / 1M	$1.250 / 1M
出力価格	$9.000 / 1M	$2.500 / 1M
合計入力トークン	13,843	44,433
出力トークン	117,518	1,819
推論トークン	0	219,524
応答時間（平均）	9.93s	27.68s
応答時間（最大）	64.36s	199.66s
応答時間（合計）	178.68s	581.26s

生成ショーケース

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#66 Gemini 3.5 Flash

none

コスト: $0.225
時間: 125.5s
トークン: 25,004 tok

#53 xAI: Grok 4.20

medium

コスト: $0.041
時間: 110.3s
トークン: 16,336 tok

スコア上位モデル

スコア vs 総コスト

応答時間（平均）

スコア vs 応答時間（平均）

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

反AIトリック	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	10.0	10.0	100.0%	0		2.53s	492	5,101	0
Grok 4.20	8.2	7.9	83.3%	1		3.95s	2,010	287	8,312

コーディング	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	8.8	7.8	88.9%	1		34.69s	8,122	75,927	0
Grok 4.20	6.3	6.6	55.6%	1		109.93s	8,307	268	103,150

複合	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	3.0	10.0	0.0%	0		0ms	0	0	0
Grok 4.20	10.0	10.0	100.0%	0		17.40s	12,909	232	9,556

データ解析と抽出	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	6.5	10.0	50.0%	0		8.10s	2,781	5,895	0
Grok 4.20	10.0	10.0	100.0%	0		4.17s	7,761	180	5,333

ドメイン特化	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	7.6	7.2	77.8%	1		10.64s	633	17,910	0
Grok 4.20	5.3	10.0	33.3%	0		27.03s	1,764	375	49,339

汎用知能	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	10.0	10.0	100.0%	0		3.46s	486	1,620	0
Grok 4.20	3.9	2.6	33.3%	1		24.48s	825	65	6,440

指示追従	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	9.8	10.0	100.0%	0		3.38s	615	3,928	0
Grok 4.20	9.8	10.0	100.0%	0		4.26s	1,362	57	6,419

パズル解決	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	10.0	10.0	100.0%	0		3.13s	558	4,640	0
Grok 4.20	7.7	10.0	66.7%	0		6.22s	1,689	149	7,913

ツール呼び出し	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	3.0	10.0	0.0%	0		0ms	0	0	0
Grok 4.20	3.0	10.0	0.0%	0		13.68s	7,275	197	6,620

雑学	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	2.8	1.6	33.3%	1		4.87s	156	2,497	0
Grok 4.20	3.0	10.0	0.0%	0		63.48s	531	9	16,442

クイック比較

比較ペアを切り替え

Gemini 3.5 FlashnonevsKimi K2.7 Codemedium Gemini 3 Flash PreviewlowvsGrok 4.20medium Claude Sonnet 4.6nonevsGrok 4.20medium Gemini 3.5 FlashnonevsGLM 5.1medium Gemini 3.5 FlashnonevsStep 3.7 Flashhigh Claude Opus 4.8nonevsGrok 4.20medium Gemini 3.5 FlashnonevsQwen3.5-Flashmedium GPT-5.3 ChatnonevsGrok 4.20medium DeepSeek V4 PrononevsGrok 4.20medium Qwen3.7 PlusnonevsGrok 4.20medium Gemini 3.5 FlashnonevsRing-2.6-1Tmedium Grok 4.20mediumvsGLM 5.2none