比較するチャート方法論

言語:

❤️ Made by XCS

AI BENCHY Compare

OpenAI: GPT-5.4 vs Qwen: Qwen3.5-27B

比較する:

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-03-06

指標	OpenAI: GPT-5.4 medium リリース: 2026-03-05	Qwen: Qwen3.5-27B medium リリース: 2026-02-24
平均スコア	8.2	8.5
順位	#7	#5
正解テスト
一貫性	8.9	9.5
結果あたりのコスト	6.533	3.283
合計コスト	$0.784	$0.394
試行ごとの合格率	86.7%	82.2%
不安定なテスト	2	1
common.totalRuns	45 (15 x 3)	45 (15 x 3)
出力トークン	1,611	1,588
推論トークン	46,321	177,639
応答時間（平均）	21.06s	48.85s
応答時間（最大）	100.41s	163.96s
応答時間（合計）	315.95s	732.75s

スコア上位モデル

スコア vs 総コスト

応答時間（平均）

平均スコア vs 応答時間（平均）

カテゴリ内訳

反AIトリック	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		5.02s	216	1,466
Qwen: Qwen3.5-27B	10.0	10.0	100.0%	0		9.69s	102	8,956

複合	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		20.57s	301	3,543
Qwen: Qwen3.5-27B	10.0	10.0	100.0%	0		163.96s	483	9,991

データ解析と抽出	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
OpenAI: GPT-5.4	9.9	10.0	100.0%	0		5.32s	234	804
Qwen: Qwen3.5-27B	9.9	10.0	100.0%	0		30.26s	270	16,150

ドメイン特化	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
OpenAI: GPT-5.4	4.0	7.2	44.4%	1		74.27s	61	34,748
Qwen: Qwen3.5-27B	4.0	10.0	33.3%	0		79.53s	43	52,368

指示追従	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		3.11s	93	897
Qwen: Qwen3.5-27B	10.0	10.0	100.0%	0		19.66s	97	11,638

Puzzle Solving	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
OpenAI: GPT-5.4	7.0	7.2	88.9%	1		9.13s	442	3,832
Qwen: Qwen3.5-27B	8.3	7.7	77.8%	1		64.61s	245	77,213

ツール呼び出し	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		13.28s	264	1,031
Qwen: Qwen3.5-27B	10.0	10.0	100.0%	0		7.45s	348	1,323

クイック比較

比較ペアを切り替え

Gemini 3 Flash PreviewlowvsGPT-5.4medium Gemini 3.1 Flash Lite PreviewhighvsGPT-5.4medium Gemini 3 Flash PreviewlowvsQwen3.5-27Bmedium Gemini 3.1 Flash Lite PreviewhighvsQwen3.5-27Bmedium Gemini 3.1 Flash Lite PreviewlowvsGPT-5.4medium Gemini 3.1 Flash Lite PreviewnonevsGPT-5.4medium GPT-5.2 ChatnonevsQwen3.5-27Bmedium Gemini 3.1 Flash Lite PreviewlowvsQwen3.5-27Bmedium GPT-5.3 ChatnonevsQwen3.5-27Bmedium Gemini 3.1 Flash Lite PreviewnonevsQwen3.5-27Bmedium Gemini 3 Flash PreviewnonevsGPT-5.4medium Claude Sonnet 4.6nonevsGPT-5.4medium