AI BENCHY Compare

ByteDance Seed: Seed-2.0-Mini vs Qwen: Qwen3.5-35B-A3B

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-05-29

指標	Seed-2.0-Mini Seed-2.0-Mini medium リリース: 2026-02-14	Qwen3.5-35B-A3B Qwen3.5-35B-A3B medium リリース: 2026-02-24

指標	Seed-2.0-Mini Seed-2.0-Mini medium リリース: 2026-02-14	Qwen3.5-35B-A3B Qwen3.5-35B-A3B medium リリース: 2026-02-24
スコア	7.1	7.3
順位	#75	#68
信頼性	10.0	10.0
一貫性	9.2	7.5
正解テスト
試行ごとの合格率	60.0%	73.3%
不安定なテスト	2	6
総実行回数	60	60
結果あたりのコスト	0.397	4.865
合計コスト	$0.044	$0.536
入力価格	$0.100 / 1M	$0.139 / 1M
出力価格	$0.400 / 1M	$1.000 / 1M
出力トークン	2,555	31,242
推論トークン	95,974	330,546
応答時間（平均）	80.22s	69.66s
応答時間（最大）	262.83s	409.98s
応答時間（合計）	1363.72s	1393.17s

スコア上位モデル

スコア vs 総コスト

応答時間（平均）

スコア vs 応答時間（平均）

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

反AIトリック	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Seed-2.0-Mini	6.6	10.0	50.0%	0		74.75s	360	9,520
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		21.13s	798	42,652

コーディング	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Seed-2.0-Mini	7.1	9.8	50.0%	0		220.48s	464	34,964
Qwen3.5-35B-A3B	6.5	10.0	50.0%	0		244.54s	14,456	88,431

複合	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Seed-2.0-Mini	10.0	10.0	100.0%	0		262.83s	404	29,806
Qwen3.5-35B-A3B	4.7	1.6	66.7%	1		75.34s	775	12,485

データ解析と抽出	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Seed-2.0-Mini	10.0	10.0	100.0%	0		24.27s	246	2,743
Qwen3.5-35B-A3B	7.3	5.9	83.3%	1		59.33s	235	19,493

ドメイン特化	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Seed-2.0-Mini	3.0	10.0	0.0%	0		0ms	0	0
Qwen3.5-35B-A3B	4.1	4.4	44.5%	2		88.34s	41	46,368

汎用知能	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Seed-2.0-Mini	5.1	3.4	33.3%	1		36.65s	213	4,210
Qwen3.5-35B-A3B	2.8	1.6	33.3%	1		30.30s	20	3,753

指示追従	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Seed-2.0-Mini	10.0	10.0	100.0%	0		17.47s	69	2,050
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		24.45s	97	17,361

パズル解決	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Seed-2.0-Mini	8.2	7.2	88.9%	1		31.79s	527	5,667
Qwen3.5-35B-A3B	8.2	7.2	88.9%	1		33.13s	3,592	26,585

ツール呼び出し	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Seed-2.0-Mini	10.0	10.0	100.0%	0		88.68s	222	5,235
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		4.65s	309	1,365

雑学	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Seed-2.0-Mini	3.0	10.0	0.0%	0		56.76s	50	1,779
Qwen3.5-35B-A3B	3.0	10.0	0.0%	0		177.35s	10,919	72,053

クイック比較

比較ペアを切り替え

Seed-2.0-MinimediumvsQwen3.6 Max Previewnone Claude Opus 4.8nonevsQwen3.5-35B-A3Bmedium Ring-2.6-1TnonevsQwen3.5-35B-A3Bmedium Seed-2.0-MinimediumvsStep 3.7 Flashhigh Claude Sonnet 4.6nonevsSeed-2.0-Minimedium Seed-2.0-MinimediumvsDeepSeek V4 Prohigh Qwen3.5-35B-A3BmediumvsStep 3.7 Flashhigh Qwen3.5-35B-A3BmediumvsStep 3.7 Flashlow Seed-2.0-MinimediumvsRing-2.6-1Tnone GPT-5.3 ChatnonevsQwen3.5-35B-A3Bmedium Gemini 3.1 Flash LitelowvsQwen3.5-35B-A3Bmedium Claude Opus 4.8nonevsSeed-2.0-Minimedium