- Peringkat
- #31
- Total token output
- 419,443
- Waktu respons (rata-rata)
- 185.56s
- Total Biaya
- $2.736
Qwen3.8 Max (0902) (high) vs Qwen3.8 Max (medium)
Skor rata-rata hampir imbang di 8.9 vs 9.0. Qwen3.8 Max (medium) memiliki biaya benchmark lebih rendah di $0.771 vs $2.736. Qwen3.8 Max (medium) lebih cepat di 23.34s vs 185.56s, dengan tingkat keberhasilan 86.4% vs 80.3%.
- Peringkat
- #29
- Total token output
- 92,047
- Waktu respons (rata-rata)
- 23.34s
- Total Biaya
- $0.771
Model yang direkomendasikan
Qwen3.8 Max (medium)
It has the best score here (9.0), while costing about 3.6x less than Qwen3.8 Max (0902) (high).
Perbandingan terperinci
| Metrik | Qwen3.8 Max (0902) Qwen3.8 Max (0902) high | Qwen3.8 Max Qwen3.8 Max medium |
|---|---|---|
| Skor | 8.9 | 9.0 |
| Peringkat | #31 | #29 |
| Keandalan | 9.8 | 10.0 |
| Konsistensi | 9.0 | 9.7 |
| Percobaan | 66/66 | 66/66 |
| Tes benar | ||
| Tingkat lulus per percobaan | 86.4% | 80.3% |
| Tes tidak stabil | 3 | 1 |
| Total Run | 66 | 66 |
| Biaya per hasil | 16.089 | 4.532 |
| Total Biaya | $2.736 | $0.771 |
| Harga input | $2.000 / 1M | $2.000 / 1M |
| Harga output | $6.000 / 1M | $6.000 / 1M |
| Total token input | 109,226 | 109,055 |
| Token output | 6,890 | 6,566 |
| Token penalaran | 412,553 | 85,481 |
| Waktu respons (rata-rata) | 185.56s | 23.34s |
| Waktu respons (maks) | 912.78s | 126.60s |
| Waktu respons (total) | 4082.41s | 513.47s |
| Parameter | 2.4T total (~100B aktif) | 2.4T total (~100B aktif) |
| Ketersediaan | Tertutup | Tertutup |
Showcase generasi model
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#31 Qwen3.8 Max (0902)
high
Reached the allocated time limit (600 seconds) without receiving showcase output.
- Biaya
- $0.000
- Waktu
- 600.0s
- Token
- 0 tok
#29 Qwen3.8 Max
medium- Biaya
- $0.028
- Waktu
- 71.9s
- Token
- 4,750 tok
Model teratas berdasarkan skor
Skor vs Total Biaya
Waktu respons (rata-rata)
Skor vs Waktu respons (rata-rata)
Total token output
Skor vs Total token output
Rincian Kategori
| Trik anti-AI | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 15.86s | 1,128 | 263 | 6,631 | |
| Qwen3.8 Max | 10.0 | 10.0 | 100.0% | 0 | 4.17s | 672 | 312 | 2,075 |
| Pemrograman | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 253.22s | 8,235 | 418 | 91,734 | |
| Qwen3.8 Max | 10.0 | 10.0 | 100.0% | 0 | 41.35s | 7,893 | 430 | 23,804 |
| Gabungan | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 8.7 | 6.9 | 83.3% | 1 | 110.39s | 79,527 | 5,215 | 28,102 | |
| Qwen3.8 Max | 8.7 | 6.9 | 83.3% | 1 | 91.25s | 81,584 | 4,526 | 30,688 |
| Parsing dan ekstraksi data | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 16.37s | 8,010 | 261 | 3,598 | |
| Qwen3.8 Max | 10.0 | 10.0 | 100.0% | 0 | 8.72s | 7,782 | 270 | 2,519 |
| Spesifik domain | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 5.9 | 7.2 | 55.6% | 1 | 658.46s | 842 | 31 | 154,450 | |
| Qwen3.8 Max | 3.0 | 10.0 | 0.0% | 0 | 41.77s | 780 | 62 | 20,803 |
| Kecerdasan umum | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 6.5 | 3.4 | 66.7% | 1 | 75.11s | 630 | 80 | 8,110 | |
| Qwen3.8 Max | 10.0 | 10.0 | 100.0% | 0 | 6.41s | 516 | 168 | 700 |
| Kepatuhan instruksi | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 9.8 | 10.0 | 100.0% | 0 | 7.55s | 927 | 86 | 1,823 | |
| Qwen3.8 Max | 10.0 | 10.0 | 100.0% | 0 | 3.49s | 699 | 102 | 914 |
| Pemecahan teka-teki | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 134.14s | 1,038 | 268 | 47,351 | |
| Qwen3.8 Max | 10.0 | 10.0 | 100.0% | 0 | 4.93s | 696 | 401 | 1,575 |
| Pemanggilan alat | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 5.21s | 8,571 | 249 | 243 | |
| Qwen3.8 Max | 10.0 | 10.0 | 100.0% | 0 | 7.83s | 8,229 | 267 | 636 |
| Pengetahuan umum | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 Max (0902) | 3.0 | 10.0 | 0.0% | 0 | 532.59s | 318 | 19 | 70,511 | |
| Qwen3.8 Max | 3.0 | 10.0 | 0.0% | 0 | 11.49s | 204 | 28 | 1,767 |
Perbandingan Cepat
Ganti Pasangan Perbandingan
GPT-5.3-CodexmediumvsQwen3.8 Max (0902)highQwen3.8 MaxmediumvsGrok 4.5highClaude Fable 5.1highvsQwen3.8 MaxmediumGPT-5.5mediumvsQwen3.8 Max (0902)highGemini 3.5 FlashmediumvsQwen3.8 Max (0902)highMuse Spark 1.3highvsQwen3.8 MaxmediumSeed 2.1 TurbohighvsQwen3.8 MaxmediumSeed 2.1 TurbolowvsQwen3.8 MaxmediumGemini 3.5 FlashlowvsQwen3.8 Max (0902)highSeed 2.1 TurbolowvsQwen3.8 Max (0902)highGemini 3.5 FlashlowvsQwen3.8 MaxmediumMuse Spark 1.3mediumvsQwen3.8 Max (0902)high