ナビゲーション
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Qwen: Qwen3.6 Plus vs xAI: Grok Build 0.1

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-05-21

指標 Qwen3.6 Plus Qwen3.6 Plus medium リリース: 2026-04-20 Grok Build 0.1 Grok Build 0.1 medium リリース: 2026-05-21
スコア 7.9 7.8
順位 #33 #41
信頼性 10.0 10.0
一貫性 9.6 8.9
正解テスト
試行ごとの合格率 70.2% 71.9%
不安定なテスト 1 3
総実行回数 57 57
結果あたりのコスト 0.118 4.064
合計コスト $0.016 $0.488
???? $0.325 / 1M $1.000 / 1M
???? $1.950 / 1M $2.000 / 1M
出力トークン 1,784 1,947
推論トークン 91,543 223,372
応答時間(平均) 17.06s 22.28s
応答時間(最大) 47.51s 88.28s
応答時間(合計) 307.07s 423.30s

スコア上位モデル

スコア vs 総コスト

応答時間(平均)

スコア vs 応答時間(平均)

合計出力トークン

スコア vs 合計出力トークン

カテゴリ内訳

反AIトリック スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Qwen3.6 Plus 10.0 10.0 100.0% 0 9.90s 207 7,557
Grok Build 0.1 10.0 10.0 100.0% 0 5.46s 195 9,825
コーディング スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Qwen3.6 Plus 3.0 10.0 0.0% 0 0ms 0 0
Grok Build 0.1 7.3 3.7 66.7% 1 30.98s 354 17,734
複合 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Qwen3.6 Plus 10.0 10.0 100.0% 0 34.95s 452 13,073
Grok Build 0.1 10.0 10.0 100.0% 0 30.81s 231 18,779
データ解析と抽出 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Qwen3.6 Plus 10.0 10.0 100.0% 0 14.95s 270 10,706
Grok Build 0.1 10.0 10.0 100.0% 0 7.76s 180 10,343
ドメイン特化 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Qwen3.6 Plus 2.9 7.2 11.1% 1 29.59s 56 33,464
Grok Build 0.1 5.3 10.0 33.3% 0 77.75s 501 111,807
汎用知能 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Qwen3.6 Plus 5.1 10.0 0.0% 0 27.05s 111 5,232
Grok Build 0.1 3.8 2.5 33.3% 1 10.14s 78 5,386
指示追従 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Qwen3.6 Plus 10.0 10.0 100.0% 0 7.54s 102 5,552
Grok Build 0.1 9.8 10.0 100.0% 0 9.62s 57 12,436
パズル解決 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Qwen3.6 Plus 10.0 10.0 100.0% 0 6.11s 298 6,868
Grok Build 0.1 6.2 7.5 55.6% 1 8.67s 161 15,476
ツール呼び出し スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Qwen3.6 Plus 10.0 10.0 100.0% 0 5.87s 267 1,330
Grok Build 0.1 10.0 10.0 100.0% 0 9.40s 180 5,319
雑学 スコア 一貫性 試行ごとの合格率 不安定なテスト 正解テスト 応答時間(平均) 出力トークン 推論トークン
Qwen3.6 Plus 3.0 10.0 0.0% 0 47.51s 21 7,761
Grok Build 0.1 3.0 10.0 0.0% 0 26.07s 10 16,267

クイック比較

比較ペアを切り替え