#30 DeepSeek V4 Pro
high- Cost
- $0.023
- Time
- 257.6s
- Tokens
- 14,870 tok
AI BENCHY Compare
概要
DeepSeek V4 Pro vs Qwen3.5 Plus 2026-02-15 の benchmark 比較: DeepSeek V4 Pro が平均スコアでリードし、8.1 vs 8.0 です。 DeepSeek V4 Pro の benchmark コストが低く、$0.098 vs $0.310 です。 DeepSeek V4 Pro の方が高速で、72.22s vs 73.79s です、成功率は 66.7% vs 73.0% です。
おすすめモデル: DeepSeek V4 Pro - ここでは最高スコア(8.1)で、Qwen3.5 Plus 2026-02-15 より約 3.2 倍低コストです。
ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-06-12
| 指標 | DeepSeek V4 Pro DeepSeek V4 Pro high | Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 medium |
|---|---|---|
| スコア | 8.1 | 8.0 |
| 順位 | #30 | #32 |
| 信頼性 | 9.6 | 10.0 |
| 一貫性 | 7.8 | 8.8 |
| 正解テスト | ||
| 試行ごとの合格率 | 66.7% | 73.0% |
| 不安定なテスト | 6 | 3 |
| 総実行回数 | 57 | 63 |
| 結果あたりのコスト | 0.978 | 2.445 |
| 合計コスト | $0.098 | $0.310 |
| 入力価格 | $0.435 / 1M | $0.260 / 1M |
| 出力価格 | $0.870 / 1M | $1.560 / 1M |
| 合計入力トークン | 35,122 | 40,918 |
| 出力トークン | 6,315 | 2,159 |
| 推論トークン | 93,205 | 189,604 |
| 応答時間(平均) | 72.22s | 73.79s |
| 応答時間(最大) | 437.44s | 266.69s |
| 応答時間(合計) | 1444.45s | 1033.07s |
Generation showcase
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
| 反AIトリック | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | 5.7 | 5.9 | 58.3% | 2 | 25.70s | 536 | 149 | 3,214 | |
| Qwen3.5 Plus 2026-02-15 | 8.2 | 7.9 | 83.3% | 1 | 45.78s | 672 | 205 | 21,236 |
| コーディング | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | 7.7 | 10.0 | 66.7% | 0 | 308.19s | 1,583 | 368 | 42,658 | |
| Qwen3.5 Plus 2026-02-15 | 6.6 | 7.1 | 44.4% | 1 | 180.70s | 6,950 | 420 | 80,595 |
| 複合 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | 10.0 | 10.0 | 100.0% | 0 | 38.17s | 14,060 | 454 | 5,836 | |
| Qwen3.5 Plus 2026-02-15 | 10.0 | 10.0 | 100.0% | 0 | 46.85s | 14,934 | 421 | 7,906 |
| データ解析と抽出 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | 10.0 | 10.0 | 100.0% | 0 | 25.03s | 7,690 | 274 | 2,166 | |
| Qwen3.5 Plus 2026-02-15 | 10.0 | 10.0 | 100.0% | 0 | 46.91s | 7,782 | 270 | 14,916 |
| ドメイン特化 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | 3.6 | 7.2 | 22.2% | 1 | 130.09s | 472 | 4,400 | 26,367 | |
| Qwen3.5 Plus 2026-02-15 | 5.3 | 10.0 | 33.3% | 0 | 17.50s | 444 | 35 | 16,680 |
| 汎用知能 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | 10.0 | 10.0 | 100.0% | 0 | 8.83s | 471 | 115 | 1,013 | |
| Qwen3.5 Plus 2026-02-15 | 4.7 | 1.6 | 66.7% | 1 | 79.86s | 344 | 73 | 8,675 |
| 指示追従 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | 7.8 | 6.6 | 83.3% | 1 | 8.73s | 627 | 66 | 2,726 | |
| Qwen3.5 Plus 2026-02-15 | 10.0 | 10.0 | 100.0% | 0 | 31.93s | 699 | 101 | 7,704 |
| パズル解決 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | 6.9 | 4.9 | 77.8% | 2 | 56.85s | 591 | 178 | 2,563 | |
| Qwen3.5 Plus 2026-02-15 | 10.0 | 10.0 | 100.0% | 0 | 32.50s | 696 | 301 | 13,853 |
| ツール呼び出し | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | 9.8 | 10.0 | 100.0% | 0 | 15.92s | 8,909 | 295 | 701 | |
| Qwen3.5 Plus 2026-02-15 | 10.0 | 10.0 | 100.0% | 0 | 7.54s | 8,193 | 309 | 909 |
| 雑学 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | 3.0 | 10.0 | 0.0% | 0 | 34.01s | 183 | 16 | 5,961 | |
| Qwen3.5 Plus 2026-02-15 | 3.0 | 10.0 | 0.0% | 0 | 103.81s | 204 | 24 | 17,130 |
比較ペアを切り替え