- 順位
- #66
- 合計出力トークン
- 73,261
- 応答時間(平均)
- 15.01s
- 合計コスト
- $1.438
Claude Sonnet 5 (medium) vs Qwen3.8 Max (0902) (low)
Qwen3.8 Max (0902) (low) が平均スコアでリードし、8.6 vs 8.5 です。 Qwen3.8 Max (0902) (low) の benchmark コストが低く、$1.131 vs $1.438 です。 Claude Sonnet 5 (medium) の方が高速で、15.01s vs 29.07s です、成功率は 76.8% vs 85.5% です。
比較対象モデル
- 順位
- #63
- 合計出力トークン
- 88,923
- 応答時間(平均)
- 29.07s
- 合計コスト
- $1.131
おすすめモデル
Claude Sonnet 5 (medium)
スコアはここでの最高値に近く(8.5 vs 8.6)、Qwen3.8 Max (0902) (low) より約 1.9 倍速く応答します。
詳細比較
| 指標 | Claude Sonnet 5 Claude Sonnet 5 medium | Qwen3.8 Max (0902) Qwen3.8 Max (0902) low |
|---|---|---|
| スコア | 8.5 | 8.6 |
| 順位 | #66 | #63 |
| 信頼性 | 10.0 | 10.0 |
| 一貫性 | 9.1 | 9.0 |
| 試行回数 | 69/69 | 69/69 |
| 正解テスト | ||
| 試行ごとの合格率 | 76.8% | 85.5% |
| 不安定なテスト | 3 | 3 |
| 総実行回数 | 69 | 69 |
| 結果あたりのコスト | 8.985 | 6.283 |
| 合計コスト | $1.438 | $1.131 |
| 入力価格 | $2.000 / 1M | $2.000 / 1M |
| 出力価格 | $10.000 / 1M | $6.000 / 1M |
| 合計入力トークン | 353,658 | 298,682 |
| 出力トークン | 54,891 | 8,374 |
| 推論トークン | 18,370 | 80,549 |
| 応答時間(平均) | 15.01s | 29.07s |
| 応答時間(最大) | 69.26s | 207.79s |
| 応答時間(合計) | 345.16s | 668.66s |
| パラメータ | ~1T 総数 (~100B アクティブ) | 2.4T 総数 (~100B アクティブ) |
| 公開状況 | クローズド | クローズド |
モデル生成ショーケース
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#66 Claude Sonnet 5
medium- コスト
- $0.007
- 時間
- 6.4s
- トークン
- 832 tok
#63 Qwen3.8 Max (0902)
low- コスト
- $0.014
- 時間
- 41.2s
- トークン
- 2,421 tok
スコア上位モデル
スコア vs 総コスト
応答時間(平均)
スコア vs 応答時間(平均)
合計出力トークン
スコア vs 合計出力トークン
カテゴリ内訳
| エージェントタスク | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 10.0 | 10.0 | 100.0% | 0 | 69.26s | 207,705 | 2,561 | 7,496 | |
| Qwen3.8 Max (0902) | 6.1 | 3.1 | 66.7% | 1 | 136.04s | 194,728 | 2,052 | 11,006 |
| 反AIトリック | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 10.0 | 10.0 | 100.0% | 0 | 3.80s | 834 | 1,220 | 446 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.72s | 984 | 212 | 1,854 |
| コーディング | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 9.0 | 7.9 | 88.9% | 1 | 17.28s | 10,590 | 13,153 | 2,379 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 37.42s | 8,127 | 485 | 17,404 |
| 複合 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 7.3 | 6.0 | 83.3% | 1 | 51.86s | 107,934 | 23,169 | 5,371 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 113.88s | 74,767 | 4,562 | 29,335 |
| データ解析と抽出 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 10.0 | 10.0 | 100.0% | 0 | 3.16s | 10,503 | 312 | 0 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 9.94s | 7,938 | 261 | 2,254 |
| ドメイン特化 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 5.3 | 10.0 | 33.3% | 0 | 20.54s | 972 | 12,137 | 1,994 | |
| Qwen3.8 Max (0902) | 5.3 | 7.2 | 44.4% | 1 | 34.93s | 1,014 | 45 | 13,881 |
| 汎用知能 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 4.8 | 3.2 | 33.3% | 1 | 4.32s | 708 | 264 | 0 | |
| Qwen3.8 Max (0902) | 6.1 | 3.1 | 66.7% | 1 | 8.91s | 594 | 120 | 820 |
| 指示追従 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 9.9 | 10.0 | 100.0% | 0 | 3.10s | 909 | 318 | 269 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.32s | 855 | 90 | 866 |
| パズル解決 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 7.7 | 10.0 | 66.7% | 0 | 2.98s | 894 | 407 | 121 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.49s | 930 | 275 | 1,248 |
| ツール呼び出し | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 10.0 | 10.0 | 100.0% | 0 | 10.70s | 12,351 | 433 | 90 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.73s | 8,463 | 249 | 126 |
| 雑学 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 3.0 | 10.0 | 0.0% | 0 | 7.06s | 258 | 917 | 204 | |
| Qwen3.8 Max (0902) | 3.0 | 10.0 | 0.0% | 0 | 13.28s | 282 | 23 | 1,755 |
クイック比較
比較ペアを切り替え
Claude Sonnet 5mediumvsMuse Spark 1.3lowClaude Sonnet 5mediumvsGrok 4.6highQwen3.8 Max (0902)lowvsGrok 4.6highClaude Sonnet 5.5highvsQwen3.8 Max (0902)lowClaude Sonnet 5.5xhighvsQwen3.8 Max (0902)lowDeepSeek V4.1 FlashmaxvsQwen3.8 Max (0902)lowClaude Sonnet 5mediumvsQwen3.8 2.4T A95BlowClaude Sonnet 5mediumvsMuse Glimmer 30BxhighClaude Sonnet 5mediumvsMuse Spark 1.1lowSeed 2.1 TurbomediumvsQwen3.8 Max (0902)lowQwen3.8 Max (0902)lowvsMiMo-V2.6-PromediumGPT-5.2mediumvsQwen3.8 Max (0902)low