- Peringkat
- #78
- Total token output
- 495,541
- Waktu respons (rata-rata)
- 118.97s
- Total Biaya
- $2.672
Qwen3.8 2.4T A95B (low) vs GLM 5.2 (high)
Qwen3.8 2.4T A95B (low) unggul dalam skor rata-rata dengan 8.1 vs 8.0. GLM 5.2 (high) memiliki biaya benchmark lebih rendah di $0.799 vs $2.672. GLM 5.2 (high) lebih cepat di 69.86s vs 118.97s, dengan tingkat keberhasilan 72.7% vs 69.7%.
Model yang Dibandingkan
- Peringkat
- #86
- Total token output
- 364,655
- Waktu respons (rata-rata)
- 69.86s
- Total Biaya
- $0.799
Model yang direkomendasikan
GLM 5.2 (high)
Its score stays close to the best score here (8.0 vs 8.1), while costing about 3.3x less than Qwen3.8 2.4T A95B (low).
Perbandingan terperinci
| Metrik | Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B low | GLM 5.2 GLM 5.2 high |
|---|---|---|
| Skor | 8.1 | 8.0 |
| Peringkat | #78 | #86 |
| Keandalan | 9.4 | 10.0 |
| Konsistensi | 9.2 | 8.6 |
| Percobaan | 66/66 | 66/66 |
| Tes benar | ||
| Tingkat lulus per percobaan | 72.7% | 69.7% |
| Tes tidak stabil | 2 | 3 |
| Total Run | 66 | 66 |
| Biaya per hasil | 17.812 | 6.849 |
| Total Biaya | $2.672 | $0.799 |
| Harga input | $2.000 / 1M | $0.650 / 1M |
| Harga output | $6.000 / 1M | $2.042 / 1M |
| Total token input | 113,279 | 83,822 |
| Token output | 121,045 | 72,040 |
| Token penalaran | 374,496 | 292,615 |
| Waktu respons (rata-rata) | 118.97s | 69.86s |
| Waktu respons (maks) | 534.21s | 599.43s |
| Waktu respons (total) | 2617.41s | 1536.98s |
| Parameter | 2.4T total (95B aktif) | 744B total (40B aktif) |
| Ketersediaan | Bobot tersedia | Sumber terbuka |
Showcase generasi model
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#78 Qwen3.8 2.4T A95B
low- Biaya
- $0.100
- Waktu
- 193.2s
- Token
- 16,767 tok
#86 GLM 5.2
high
Reached the allocated time limit (300 seconds) without receiving showcase output.
- Biaya
- $0.000
- Waktu
- 300.0s
- Token
- 0 tok
Model teratas berdasarkan skor
Skor vs Total Biaya
Waktu respons (rata-rata)
Skor vs Waktu respons (rata-rata)
Total token output
Skor vs Total token output
Rincian Kategori
| Trik anti-AI | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 22.04s | 1,104 | 397 | 4,814 | |
| GLM 5.2 | 10.0 | 10.0 | 100.0% | 0 | 5.80s | 639 | 406 | 2,660 |
| Pemrograman | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 2.4T A95B | 7.8 | 9.3 | 66.7% | 0 | 172.53s | 6,716 | 21,405 | 57,399 | |
| GLM 5.2 | 6.4 | 8.6 | 33.3% | 0 | 73.03s | 5,124 | 2,302 | 22,546 |
| Gabungan | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 2.4T A95B | 8.2 | 6.9 | 66.7% | 1 | 231.85s | 85,267 | 8,008 | 50,681 | |
| GLM 5.2 | 10.0 | 10.0 | 100.0% | 0 | 321.47s | 61,516 | 18,824 | 63,861 |
| Parsing dan ekstraksi data | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 22.27s | 7,956 | 839 | 2,445 | |
| GLM 5.2 | 10.0 | 10.0 | 100.0% | 0 | 5.81s | 7,143 | 435 | 1,414 |
| Spesifik domain | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 2.4T A95B | 3.2 | 9.3 | 0.0% | 0 | 287.65s | 1,008 | 16,133 | 156,114 | |
| GLM 5.2 | 3.1 | 6.5 | 11.1% | 1 | 126.85s | 560 | 49,045 | 157,522 |
| Kecerdasan umum | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 2.4T A95B | 6.1 | 3.1 | 66.7% | 1 | 22.97s | 606 | 44 | 1,497 | |
| GLM 5.2 | 10.0 | 10.0 | 100.0% | 0 | 12.90s | 498 | 63 | 1,743 |
| Kepatuhan instruksi | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 2.4T A95B | 9.8 | 10.0 | 100.0% | 0 | 19.54s | 903 | 263 | 1,480 | |
| GLM 5.2 | 10.0 | 10.0 | 100.0% | 0 | 4.26s | 678 | 151 | 1,210 |
| Pemecahan teka-teki | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 43.37s | 1,026 | 1,154 | 25,563 | |
| GLM 5.2 | 6.0 | 4.6 | 66.7% | 2 | 33.71s | 665 | 568 | 22,392 |
| Pemanggilan alat | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 2.4T A95B | 10.0 | 10.0 | 100.0% | 0 | 25.88s | 8,481 | 302 | 975 | |
| GLM 5.2 | 10.0 | 10.0 | 100.0% | 0 | 9.25s | 6,861 | 246 | 503 |
| Pengetahuan umum | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8 2.4T A95B | 3.0 | 10.0 | 0.0% | 0 | 422.46s | 212 | 72,500 | 73,528 | |
| GLM 5.2 | 3.0 | 10.0 | 0.0% | 0 | 127.82s | 138 | 0 | 18,764 |
Perbandingan Cepat
Ganti Pasangan Perbandingan
GPT-5 MinimediumvsQwen3.8 2.4T A95BlowMuse Glimmer 30BxhighvsQwen3.8 2.4T A95BlowDeepSeek V4 Flash 0731lowvsGLM 5.2highInklingmediumvsGLM 5.2highQwen3.8 2.4T A95BlowvsGrok 4.7mediumQwen3.8 2.4T A95BlowvsInklinghighMuse Spark 1.1highvsQwen3.8 2.4T A95BlowGrok 4.7mediumvsGLM 5.2highGrok 4.7lowvsGLM 5.2highKimi K3maxvsGLM 5.2highDeepSeek V4 Flash 0731highvsQwen3.8 2.4T A95BlowGPT-5.2 ChatnonevsGLM 5.2high