ナビゲーション
AI BENCHY
Advertise here

比較対象モデル

Qwen3.6 35B A3B (medium) vs Qwen3.5-27B (medium) vs DeepSeek V4 Flash 0423 (high) ベンチマーク比較: DeepSeek V4 Flash 0423 (high) は スコア で 7.6 と首位です。 Qwen3.6 35B A3B (medium) は 信頼性 で 10.0 と首位です。 DeepSeek V4 Flash 0423 (high) は 合計コスト が最も低く、$0.031 です。 DeepSeek V4 Flash 0423 (high)51.81s で最速です。

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-08-15

順位
#148
合計出力トークン
743,292
応答時間(平均)
58.49s
合計コスト
$0.750
順位
#87
合計出力トークン
614,909
応答時間(平均)
113.28s
合計コスト
$0.982
順位
#76
合計出力トークン
211,310
応答時間(平均)
51.81s
合計コスト
$0.031
おすすめモデル DeepSeek V4 Flash 0423 (high)

ここでは最高スコア(7.6)で、この比較の他のモデル より約 28.1 倍低コストです。

詳細比較

指標 Qwen3.6 35B A3B Qwen3.6 35B A3B medium リリース: 2026-04-20 Qwen3.5-27B Qwen3.5-27B medium リリース: 2026-02-24 DeepSeek V4 Flash 0423 DeepSeek V4 Flash 0423 high リリース: 2026-04-24
スコア 6.6 7.5 7.6
順位 #148 #87 #76
信頼性 10.0 10.0 10.0
一貫性 9.2 7.8 8.5
試行回数 66/66 66/66 66/66
正解テスト
試行ごとの合格率 57.6% 75.8% 69.7%
不安定なテスト 2 6 4
総実行回数 66 66 66
結果あたりのコスト 6.212 8.217 0.446
合計コスト $0.750 $0.982 $0.031
入力価格 $0.150 / 1M $0.195 / 1M $0.066 / 1M
出力価格 $1.000 / 1M $1.560 / 1M $0.132 / 1M
合計入力トークン 85,148 111,644 108,480
出力トークン 61,736 16,113 37,229
推論トークン 681,556 598,796 174,081
応答時間(平均) 58.49s 113.28s 51.81s
応答時間(最大) 817.57s 1026.43s 218.13s
応答時間(合計) 1169.83s 2492.26s 1139.75s
パラメータ 35B 総数 (3B アクティブ) 27B 284B 総数 (13B アクティブ)
公開状況 オープンソース オープンソース オープンソース

モデル生成ショーケース

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#148 Qwen3.6 35B A3B

medium
無効なSVG
コスト
$0.000
時間
300.0s
トークン
0 tok

#87 Qwen3.5-27B

medium
コスト
$0.008
時間
62.0s
トークン
3,099 tok

#76 DeepSeek V4 Flash 0423

high
コスト
$0.003
時間
93.1s
トークン
7,926 tok

スコア上位モデル

スコア vs 総コスト

応答時間(平均)

スコア vs 応答時間(平均)

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

コーディング スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 入力トークン 出力トークン 推論トークン
Qwen3.6 35B A3B 7.7 10.0 66.7% 0 50.55s 5,051 7,929 37,223
Qwen3.5-27B 6.2 7.1 55.6% 1 160.69s 7,895 6,381 89,388
DeepSeek V4 Flash 0423 7.8 10.0 66.7% 0 50.60s 7,279 395 34,862

クイック比較

比較ペアを切り替え