比較するチャート方法論

言語:

❤️ Made by XCS

AI BENCHY Compare

Qwen: Qwen3.5-122B-A10B vs StepFun: Step 3.5 Flash

比較する:

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-03-06

指標	Qwen: Qwen3.5-122B-A10B medium リリース: 2026-02-24	StepFun: Step 3.5 Flash medium リリース: 2026-02-01 無料で利用可能
順位	#10	#13
平均スコア	7.7	7.4
一貫性	9.0	9.1
結果あたりのコスト	4.095	0.000
合計コスト	$0.492	$0.000
正解テスト
試行ごとの合格率	79.2%	68.8%
不安定なテスト	2	2
総実行回数	48 (16 x 3)	48 (16 x 3)
出力トークン	17,292	71,452
推論トークン	145,625	155,147
応答時間（平均）	29.74s	29.10s
応答時間（最大）	119.29s	170.45s
応答時間（合計）	475.83s	290.96s

スコア上位モデル

スコア vs 総コスト

応答時間（平均）

平均スコア vs 応答時間（平均）

カテゴリ内訳

反AIトリック	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Qwen: Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		6.99s	248	10,486
StepFun: Step 3.5 Flash	10.0	10.0	100.0%	0		18.54s	13,924	17,208

複合	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Qwen: Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		107.79s	483	11,337
StepFun: Step 3.5 Flash	10.0	10.0	100.0%	0		29.57s	1,176	12,984

データ解析と抽出	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Qwen: Qwen3.5-122B-A10B	9.9	10.0	100.0%	0		23.41s	270	16,558
StepFun: Step 3.5 Flash	10.0	10.0	100.0%	0		15.01s	600	13,886

ドメイン特化	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Qwen: Qwen3.5-122B-A10B	10.0	7.2	11.1%	1		63.40s	15,537	64,889
StepFun: Step 3.5 Flash	4.0	7.2	44.4%	1		170.45s	45,350	90,436

汎用知能	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Qwen: Qwen3.5-122B-A10B	10.0	2.2	33.3%	1		34.11s	66	7,592
StepFun: Step 3.5 Flash	6.0	10.0	0.0%	0		6.54s	2,214	2,584

指示追従	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Qwen: Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		9.88s	77	7,372
StepFun: Step 3.5 Flash	9.0	6.8	83.3%	1		4.98s	2,284	3,412

Puzzle Solving	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Qwen: Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		17.18s	289	26,165
StepFun: Step 3.5 Flash	4.0	10.0	33.3%	0		7.72s	5,629	10,835

ツール呼び出し	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Qwen: Qwen3.5-122B-A10B	10.0	10.0	100.0%	0		4.60s	322	1,226
StepFun: Step 3.5 Flash	10.0	10.0	100.0%	0		11.91s	275	3,802

クイック比較

比較ペアを切り替え

GPT-5.2 ChatnonevsStep 3.5 Flashmedium無料で利用可能 Gemini 3.1 Flash Lite PreviewlowvsStep 3.5 Flashmedium無料で利用可能 GPT-5.3 ChatnonevsStep 3.5 Flashmedium無料で利用可能 Gemini 3 Flash PreviewnonevsStep 3.5 Flashmedium無料で利用可能 GPT-5.2 ChatnonevsQwen3.5-122B-A10Bmedium Gemini 3.1 Flash Lite PreviewnonevsStep 3.5 Flashmedium無料で利用可能 Gemini 3.1 Flash Lite PreviewlowvsQwen3.5-122B-A10Bmedium GPT-5.3 ChatnonevsQwen3.5-122B-A10Bmedium Gemini 3.1 Flash Lite PreviewhighvsQwen3.5-122B-A10Bmedium Gemini 3 Flash PreviewlowvsQwen3.5-122B-A10Bmedium Gemini 3 Flash PreviewnonevsQwen3.5-122B-A10Bmedium Gemini 3.1 Flash Lite PreviewnonevsQwen3.5-122B-A10Bmedium