- 順位
- #28
- 合計出力トークン
- 125,316
- 応答時間(平均)
- 38.97s
- 合計コスト
- $4.163
GPT-5.5 (medium) vs Qwen3.8 Max (medium)
平均スコアは 9.0 vs 9.0 でほぼ同等です。 Qwen3.8 Max (medium) の benchmark コストが低く、$0.771 vs $4.163 です。 Qwen3.8 Max (medium) の方が高速で、23.34s vs 38.97s です、成功率は 87.9% vs 80.3% です。
比較対象モデル
- 順位
- #29
- 合計出力トークン
- 92,047
- 応答時間(平均)
- 23.34s
- 合計コスト
- $0.771
おすすめモデル
Qwen3.8 Max (medium)
ここでは最高スコア(9.0)で、GPT-5.5 (medium) より約 5.4 倍低コストです。
詳細比較
| 指標 | GPT-5.5 GPT-5.5 medium | Qwen3.8 Max Qwen3.8 Max medium |
|---|---|---|
| スコア | 9.0 | 9.0 |
| 順位 | #28 | #29 |
| 信頼性 | 10.0 | 10.0 |
| 一貫性 | 8.9 | 9.7 |
| 試行回数 | 66/66 | 66/66 |
| 正解テスト | ||
| 試行ごとの合格率 | 87.9% | 80.3% |
| 不安定なテスト | 3 | 1 |
| 総実行回数 | 66 | 66 |
| 結果あたりのコスト | 23.127 | 4.532 |
| 合計コスト | $4.163 | $0.771 |
| 入力価格 | $5.000 / 1M | $2.000 / 1M |
| 出力価格 | $30.000 / 1M | $6.000 / 1M |
| 合計入力トークン | 80,668 | 109,055 |
| 出力トークン | 5,617 | 6,566 |
| 推論トークン | 119,699 | 85,481 |
| 応答時間(平均) | 38.97s | 23.34s |
| 応答時間(最大) | 332.10s | 126.60s |
| 応答時間(合計) | 857.43s | 513.47s |
| パラメータ | ~1.5T 総数 (~100B アクティブ) | 2.4T 総数 (~100B アクティブ) |
| 公開状況 | クローズド | クローズド |
モデル生成ショーケース
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#28 GPT-5.5
medium- コスト
- $0.112
- 時間
- 71.9s
- トークン
- 3,807 tok
#29 Qwen3.8 Max
medium- コスト
- $0.028
- 時間
- 71.9s
- トークン
- 4,750 tok
スコア上位モデル
スコア vs 総コスト
応答時間(平均)
スコア vs 応答時間(平均)
合計出力トークン
スコア vs 合計出力トークン
カテゴリ内訳
| 反AIトリック | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.5 | 10.0 | 10.0 | 100.0% | 0 | 4.66s | 606 | 250 | 1,335 | |
| Qwen3.8 Max | 10.0 | 10.0 | 100.0% | 0 | 4.17s | 672 | 312 | 2,075 |
| コーディング | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.5 | 8.8 | 7.8 | 88.9% | 1 | 59.77s | 7,305 | 362 | 24,959 | |
| Qwen3.8 Max | 10.0 | 10.0 | 100.0% | 0 | 41.35s | 7,893 | 430 | 23,804 |
| 複合 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.5 | 10.0 | 10.0 | 100.0% | 0 | 33.52s | 57,466 | 3,944 | 6,735 | |
| Qwen3.8 Max | 8.7 | 6.9 | 83.3% | 1 | 91.25s | 81,584 | 4,526 | 30,688 |
| データ解析と抽出 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.5 | 10.0 | 10.0 | 100.0% | 0 | 4.18s | 7,140 | 234 | 593 | |
| Qwen3.8 Max | 10.0 | 10.0 | 100.0% | 0 | 8.72s | 7,782 | 270 | 2,519 |
| ドメイン特化 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.5 | 5.3 | 7.2 | 44.4% | 1 | 168.16s | 732 | 67 | 80,505 | |
| Qwen3.8 Max | 3.0 | 10.0 | 0.0% | 0 | 41.77s | 780 | 62 | 20,803 |
| 汎用知能 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.5 | 10.0 | 10.0 | 100.0% | 0 | 4.16s | 477 | 138 | 223 | |
| Qwen3.8 Max | 10.0 | 10.0 | 100.0% | 0 | 6.41s | 516 | 168 | 700 |
| 指示追従 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.5 | 10.0 | 10.0 | 100.0% | 0 | 3.36s | 660 | 93 | 538 | |
| Qwen3.8 Max | 10.0 | 10.0 | 100.0% | 0 | 3.49s | 699 | 102 | 914 |
| パズル解決 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.5 | 10.0 | 10.0 | 100.0% | 0 | 6.76s | 642 | 241 | 2,225 | |
| Qwen3.8 Max | 10.0 | 10.0 | 100.0% | 0 | 4.93s | 696 | 401 | 1,575 |
| ツール呼び出し | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.5 | 10.0 | 10.0 | 100.0% | 0 | 10.57s | 5,445 | 258 | 832 | |
| Qwen3.8 Max | 10.0 | 10.0 | 100.0% | 0 | 7.83s | 8,229 | 267 | 636 |
| 雑学 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.5 | 2.8 | 1.6 | 33.3% | 1 | 37.86s | 195 | 30 | 1,754 | |
| Qwen3.8 Max | 3.0 | 10.0 | 0.0% | 0 | 11.49s | 204 | 28 | 1,767 |
クイック比較
比較ペアを切り替え
Claude Fable 5.1highvsGPT-5.5mediumQwen3.8 MaxmediumvsGrok 4.5highClaude Fable 5.1highvsQwen3.8 MaxmediumGPT-5.5mediumvsGrok 4.5highGPT-5.5mediumvsQwen3.8 Max (0902)highMuse Spark 1.3highvsQwen3.8 MaxmediumMuse Spark 1.3highvsGPT-5.5mediumQwen3.8 MaxmediumvsParetononeSeed 2.1 TurbohighvsQwen3.8 MaxmediumSeed 2.1 TurbolowvsGPT-5.5mediumGPT-5.5mediumvsParetononeSeed 2.1 TurbohighvsGPT-5.5medium