AI BENCHY Compare

Google: Gemini 3.1 Flash Lite vs xAI: Grok Build 0.1

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-05-22

指標	Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite minimal リリース: 2026-05-08	Grok Build 0.1 Grok Build 0.1 none リリース: 2026-05-21

指標	Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite minimal リリース: 2026-05-08	Grok Build 0.1 Grok Build 0.1 none リリース: 2026-05-21
スコア	6.7	6.6
順位	#78	#82
信頼性	10.0	10.0
一貫性	8.8	8.0
正解テスト
試行ごとの合格率	56.7%	60.4%
不安定なテスト	3	4
総実行回数	60	57
結果あたりのコスト	0.123	7.805
合計コスト	$0.013	$0.547
????	$0.250 / 1M	$1.000 / 1M
????	$1.500 / 1M	$2.000 / 1M
出力トークン	2,481	267,275
推論トークン	0	0
応答時間（平均）	1.37s	28.69s
応答時間（最大）	4.49s	138.35s
応答時間（合計）	27.32s	459.00s

スコア上位モデル

スコア vs 総コスト

応答時間（平均）

スコア vs 応答時間（平均）

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

反AIトリック	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Gemini 3.1 Flash Lite	8.3	10.0	75.0%	0		1.10s	639	0
Grok Build 0.1	8.7	7.9	91.7%	1		6.30s	11,162	0

コーディング	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Gemini 3.1 Flash Lite	6.8	10.0	50.0%	0		951ms	660	0
Grok Build 0.1	10.0	10.0	100.0%	0		21.41s	16,568	0

複合	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Gemini 3.1 Flash Lite	3.0	10.0	0.0%	0		2.53s	357	0
Grok Build 0.1	0.0	0.0	0.0%	0		0ms	0	0

データ解析と抽出	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		1.04s	279	0
Grok Build 0.1	4.7	1.6	66.7%	1		9.33s	6,359	0

ドメイン特化	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Gemini 3.1 Flash Lite	2.9	7.2	11.1%	1		1.02s	15	0
Grok Build 0.1	3.6	7.2	22.2%	1		103.71s	179,469	0

汎用知能	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Gemini 3.1 Flash Lite	4.0	10.0	0.0%	0		791ms	63	0
Grok Build 0.1	4.3	10.0	0.0%	0		12.47s	6,647	0

指示追従	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		932ms	72	0
Grok Build 0.1	9.8	10.0	100.0%	0		7.36s	8,970	0

パズル解決	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Gemini 3.1 Flash Lite	6.0	4.6	66.7%	2		2.15s	153	0
Grok Build 0.1	6.4	7.7	55.6%	1		9.55s	14,982	0

ツール呼び出し	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		3.51s	234	0
Grok Build 0.1	0.0	0.0	0.0%	0		0ms	0	0

雑学	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Gemini 3.1 Flash Lite	3.0	10.0	0.0%	0		724ms	9	0
Grok Build 0.1	3.0	10.0	0.0%	0		36.09s	23,118	0

クイック比較

比較ペアを切り替え

Gemini 3.1 Flash LiteminimalvsKimi K2.5medium DeepSeek V4 ProhighvsGemini 3.1 Flash Liteminimal Gemini 3.1 Flash LiteminimalvsGrok 4.20medium Qwen3.6 27BmediumvsGrok Build 0.1none DeepSeek V4 ProhighvsGrok Build 0.1none Kimi K2.5mediumvsGrok Build 0.1none Gemini 3.1 Flash LiteminimalvsQwen3.6 27Bmedium Gemini 3.1 Flash LiteminimalvsGPT-5.5none Gemini 3.1 Flash LiteminimalvsGPT-5 Minimedium Gemini 3.1 Flash LiteminimalvsMiMo-V2-Omnimedium Gemini 3.1 Flash LiteminimalvsQwen3.5 Plus 2026-02-15none DeepSeek V3.2mediumvsGemini 3.1 Flash Liteminimal