- Peringkat
- #67
- Total token output
- 259,032
- Waktu respons (rata-rata)
- 48.35s
- Total Biaya
- $2.046
Qwen3.7 Max (medium) vs Grok 4.6 (high)
Skor rata-rata hampir imbang di 8.5 vs 8.5. Qwen3.7 Max (medium) memiliki biaya benchmark lebih rendah di $2.046 vs $2.629. Qwen3.7 Max (medium) lebih cepat di 48.35s vs 87.48s, dengan tingkat keberhasilan 85.5% vs 82.6%.
Model yang Dibandingkan
- Peringkat
- #64
- Total token output
- 312,614
- Waktu respons (rata-rata)
- 87.48s
- Total Biaya
- $2.629
Model yang direkomendasikan
Qwen3.7 Max (medium)
It has the best score here (8.5), while responding about 1.8x faster than Grok 4.6 (high).
Perbandingan terperinci
| Metrik | Qwen3.7 Max Qwen3.7 Max medium | Grok 4.6 Grok 4.6 high |
|---|---|---|
| Skor | 8.5 | 8.5 |
| Peringkat | #67 | #64 |
| Keandalan | 10.0 | 10.0 |
| Konsistensi | 8.7 | 10.0 |
| Percobaan | 69/69 | 69/69 |
| Tes benar | ||
| Tingkat lulus per percobaan | 85.5% | 82.6% |
| Tes tidak stabil | 4 | 0 |
| Total Run | 69 | 69 |
| Biaya per hasil | 12.033 | 13.833 |
| Total Biaya | $2.046 | $2.629 |
| Harga input | $1.475 / 1M | $2.000 / 1M |
| Harga output | $4.425 / 1M | $6.000 / 1M |
| Total token input | 367,848 | 376,233 |
| Token output | 8,753 | 6,687 |
| Token penalaran | 250,279 | 305,927 |
| Waktu respons (rata-rata) | 48.35s | 87.48s |
| Waktu respons (maks) | 556.06s | 618.49s |
| Waktu respons (total) | 1112.11s | 2012.15s |
| Parameter | ~1T total (~40B aktif) | ~1.7T total (~170B aktif) |
| Ketersediaan | Tertutup | Tertutup |
Showcase generasi model
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#67 Qwen3.7 Max
medium- Biaya
- $0.017
- Waktu
- 68.8s
- Token
- 4,526 tok
#64 SpaceXAI: Grok 4.6
high- Biaya
- $0.107
- Waktu
- 265.1s
- Token
- 18,001 tok
Model teratas berdasarkan skor
Skor vs Total Biaya
Waktu respons (rata-rata)
Skor vs Waktu respons (rata-rata)
Total token output
Skor vs Total token output
Rincian Kategori
| Tugas agen | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 6.1 | 3.1 | 66.7% | 1 | 137.00s | 261,819 | 3,005 | 29,925 | |
| Grok 4.6 | 5.0 | 10.0 | 0.0% | 0 | 160.89s | 268,958 | 1,593 | 28,804 |
| Trik anti-AI | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 6.36s | 672 | 222 | 8,742 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 14.44s | 2,991 | 79 | 6,805 |
| Pemrograman | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 35.31s | 7,893 | 423 | 34,808 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 102.20s | 9,579 | 379 | 51,829 |
| Gabungan | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 8.7 | 6.9 | 83.3% | 1 | 287.83s | 78,594 | 3,985 | 96,450 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 91.77s | 68,548 | 3,931 | 34,529 |
| Parsing dan ekstraksi data | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 8.80s | 7,782 | 270 | 6,254 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 16.08s | 8,937 | 225 | 6,590 |
| Spesifik domain | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 4.1 | 4.4 | 44.5% | 2 | 52.45s | 780 | 61 | 41,143 | |
| Grok 4.6 | 5.3 | 10.0 | 33.3% | 0 | 369.95s | 2,523 | 14 | 154,471 |
| Kecerdasan umum | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 11.70s | 516 | 135 | 4,457 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 19.51s | 1,077 | 56 | 2,448 |
| Kepatuhan instruksi | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 7.46s | 699 | 102 | 5,452 | |
| Grok 4.6 | 9.8 | 10.0 | 100.0% | 0 | 13.82s | 1,857 | 57 | 4,318 |
| Pemecahan teka-teki | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 8.84s | 696 | 259 | 8,908 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 15.56s | 2,430 | 122 | 5,706 |
| Pemanggilan alat | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 10.0 | 10.0 | 100.0% | 0 | 6.63s | 8,193 | 267 | 1,220 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 13.30s | 8,544 | 216 | 1,505 |
| Pengetahuan umum | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3.7 Max | 3.0 | 10.0 | 0.0% | 0 | 33.37s | 204 | 24 | 12,920 | |
| Grok 4.6 | 3.0 | 10.0 | 0.0% | 0 | 54.22s | 789 | 15 | 8,922 |
Perbandingan Cepat
Ganti Pasangan Perbandingan
Muse Spark 1.3lowvsQwen3.7 MaxmediumMuse Spark 1.3lowvsGrok 4.6highClaude Sonnet 5mediumvsGrok 4.6highQwen3.8 Max (0902)lowvsGrok 4.6highClaude Sonnet 5.5xhighvsGrok 4.6highMuse Spark 1.1lowvsGrok 4.6highMuse Glimmer 30BxhighvsQwen3.7 MaxmediumClaude Sonnet 5.5highvsQwen3.7 MaxmediumDeepSeek V4.1 FlashmaxvsGrok 4.6highClaude Sonnet 5.5xhighvsQwen3.7 MaxmediumMuse Spark 1.1lowvsQwen3.7 MaxmediumQwen3.8 2.4T A95BlowvsGrok 4.6high