AI BENCHY Compare

Google: Gemini 3.5 Flash vs OpenAI: gpt-oss-120b

概要

Gemini 3.5 Flash (high) vs gpt-oss-120b の benchmark 比較: Gemini 3.5 Flash (high) が平均スコアでリードし、9.8 vs 4.0 です。 gpt-oss-120b の benchmark コストが低く、$0.010 vs $1.115 です。 Gemini 3.5 Flash (high) の方が高速で、8.84s vs 21.61s です、成功率は 96.8% vs 34.9% です。

おすすめモデル: Gemini 3.5 Flash (high) - ここでは最高スコア（9.8）で、gpt-oss-120b より約 2.4 倍速く応答します。

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-07-09

指標	Gemini 3.5 Flash Gemini 3.5 Flash high リリース: 2026-05-19	gpt-oss-120b gpt-oss-120b none リリース: 2025-08-05 無料で利用可能

指標	Gemini 3.5 Flash Gemini 3.5 Flash high リリース: 2026-05-19	gpt-oss-120b gpt-oss-120b none リリース: 2025-08-05 無料で利用可能
スコア	9.8	4.0
順位	#1	#183
信頼性	10.0	10.0
一貫性	9.6	8.2
正解テスト
試行ごとの合格率	96.8%	34.9%
不安定なテスト	1	2
総実行回数	63	57
結果あたりのコスト	5.575	0.168
合計コスト	$1.115	$0.010
入力価格	$1.500 / 1M	$0.036 / 1M
出力価格	$9.000 / 1M	$0.180 / 1M
合計入力トークン	37,594	9,081
出力トークン	1,975	51,664
推論トークン	115,638	0
応答時間（平均）	8.84s	21.61s
応答時間（最大）	34.82s	113.71s
応答時間（合計）	185.57s	345.79s

生成ショーケース

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#1 Gemini 3.5 Flash

high

コスト: $0.208
時間: 118.2s
トークン: 23,158 tok

#183 gpt-oss-120b

none

このモデルのショーケース結果はまだ生成されていません。

コスト: $0.000
時間: -
トークン: 0 tok

スコア上位モデル

スコア vs 総コスト

応答時間（平均）

スコア vs 応答時間（平均）

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

反AIトリック	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	10.0	10.0	100.0%	0		2.57s	492	174	4,997
gpt-oss-120b	6.5	10.0	50.0%	0		32.84s	1,336	8,676	0

コーディング	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	10.0	10.0	100.0%	0		22.96s	8,118	456	47,129
gpt-oss-120b	1.5	4.0	22.2%	1		9.57s	901	3,232	0

複合	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	10.0	10.0	100.0%	0		22.37s	12,873	351	16,323
gpt-oss-120b	3.0	10.0	0.0%	0		0ms	0	0	0

データ解析と抽出	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	10.0	10.0	100.0%	0		6.43s	7,548	279	8,466
gpt-oss-120b	6.5	10.0	50.0%	0		7.12s	2,421	598	0

ドメイン特化	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	7.6	7.2	77.8%	1		14.09s	633	12	24,721
gpt-oss-120b	3.0	10.0	0.0%	0		34.98s	1,294	29,483	0

汎用知能	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	10.0	10.0	100.0%	0		3.63s	486	115	1,650
gpt-oss-120b	4.8	10.0	0.0%	0		10.79s	584	615	0

指示追従	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	10.0	10.0	100.0%	0		3.35s	615	70	3,799
gpt-oss-120b	9.8	10.0	100.0%	0		5.06s	1,043	1,940	0

パズル解決	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	10.0	10.0	100.0%	0		3.23s	558	241	4,940
gpt-oss-120b	6.0	7.2	55.6%	1		8.21s	1,188	3,982	0

ツール呼び出し	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	9.8	10.0	100.0%	0		4.96s	6,115	265	1,608
gpt-oss-120b	3.0	10.0	0.0%	0		0ms	0	0	0

雑学	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	入力トークン	出力トークン	推論トークン
Gemini 3.5 Flash	10.0	10.0	100.0%	0		3.94s	156	12	2,005
gpt-oss-120b	3.0	10.0	0.0%	0		47.29s	314	3,138	0

クイック比較

比較ペアを切り替え

gpt-oss-120bnone無料で利用可能vsQwen3.5-9Bmedium gpt-oss-120bnone無料で利用可能vsGLM 4.7 Flashmedium Gemini 3.5 FlashhighvsGPT-5.6 Sollow Gemini 3.5 FlashhighvsQwen3.7 Maxmedium Gemini 3.5 FlashhighvsGPT-5.6 Solmedium Gemini 3.5 FlashhighvsGPT-5.5low Claude Fable 5mediumvsGemini 3.5 Flashhigh gpt-oss-120bnone無料で利用可能vsQwen3 Coder Nextmedium MiniMax M2.5mediumvsgpt-oss-120bnone無料で利用可能 Gemini 3.5 FlashhighvsGPT-5.5medium Gemini 3.5 FlashhighvsGPT-5.3-Codexmedium Cobuddymediumvsgpt-oss-120bnone無料で利用可能