ナビゲーション
AI BENCHY
Advertise here

AI BENCHY Compare

Google: Gemini 3.1 Flash Lite vs xAI: Grok Build 0.1

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-05-21

指標 Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite low リリース: 2026-05-08 Grok Build 0.1 Grok Build 0.1 medium リリース: 2026-05-21
スコア 7.6 7.8
順位 #50 #41
信頼性 10.0 10.0
一貫性 9.2 8.9
正解テスト
試行ごとの合格率 68.4% 71.9%
不安定なテスト 2 3
総実行回数 57 57
結果あたりのコスト 0.203 4.064
合計コスト $0.025 $0.488
???? $0.250 / 1M $1.000 / 1M
???? $1.500 / 1M $2.000 / 1M
出力トークン 2,702 1,947
推論トークン 8,596 223,372
応答時間(平均) 1.92s 22.28s
応答時間(最大) 5.66s 88.28s
応答時間(合計) 36.49s 423.30s

スコア上位モデル

スコア vs 総コスト

応答時間(平均)

スコア vs 応答時間(平均)

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

反AIトリック スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Gemini 3.1 Flash Lite 7.3 6.2 75.0% 2 1.84s 1,013 1,548
Grok Build 0.1 10.0 10.0 100.0% 0 5.46s 195 9,825
コーディング スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Gemini 3.1 Flash Lite 10.0 10.0 100.0% 0 1.46s 441 408
Grok Build 0.1 7.3 3.7 66.7% 1 30.98s 354 17,734
複合 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Gemini 3.1 Flash Lite 3.0 10.0 0.0% 0 4.48s 348 975
Grok Build 0.1 10.0 10.0 100.0% 0 30.81s 231 18,779
データ解析と抽出 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Gemini 3.1 Flash Lite 10.0 10.0 100.0% 0 1.44s 291 697
Grok Build 0.1 10.0 10.0 100.0% 0 7.76s 180 10,343
ドメイン特化 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Gemini 3.1 Flash Lite 5.3 10.0 33.3% 0 1.52s 15 1,214
Grok Build 0.1 5.3 10.0 33.3% 0 77.75s 501 111,807
汎用知能 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Gemini 3.1 Flash Lite 4.0 10.0 0.0% 0 1.37s 69 438
Grok Build 0.1 3.8 2.5 33.3% 1 10.14s 78 5,386
指示追従 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Gemini 3.1 Flash Lite 10.0 10.0 100.0% 0 1.52s 72 760
Grok Build 0.1 9.8 10.0 100.0% 0 9.62s 57 12,436
パズル解決 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Gemini 3.1 Flash Lite 10.0 10.0 100.0% 0 1.40s 210 1,191
Grok Build 0.1 6.2 7.5 55.6% 1 8.67s 161 15,476
ツール呼び出し スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Gemini 3.1 Flash Lite 10.0 10.0 100.0% 0 5.66s 234 945
Grok Build 0.1 10.0 10.0 100.0% 0 9.40s 180 5,319
雑学 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Gemini 3.1 Flash Lite 3.0 10.0 0.0% 0 1.46s 9 420
Grok Build 0.1 3.0 10.0 0.0% 0 26.07s 10 16,267

クイック比較

比較ペアを切り替え