- Peringkat
- #65
- Total token output
- 134,695
- Waktu respons (rata-rata)
- 17.73s
- Total Biaya
- $0.911
Muse Spark 1.3 (low) vs Grok 4.6 (high)
Skor rata-rata hampir imbang di 8.5 vs 8.5. Muse Spark 1.3 (low) memiliki biaya benchmark lebih rendah di $0.911 vs $2.629. Muse Spark 1.3 (low) lebih cepat di 17.73s vs 87.48s, dengan tingkat keberhasilan 82.6% vs 82.6%.
Model yang Dibandingkan
- Peringkat
- #64
- Total token output
- 312,614
- Waktu respons (rata-rata)
- 87.48s
- Total Biaya
- $2.629
Model yang direkomendasikan
Muse Spark 1.3 (low)
It has the best score here (8.5), while costing about 2.9x less than Grok 4.6 (high).
Perbandingan terperinci
| Metrik | Muse Spark 1.3 Muse Spark 1.3 low | Grok 4.6 Grok 4.6 high |
|---|---|---|
| Skor | 8.5 | 8.5 |
| Peringkat | #65 | #64 |
| Keandalan | 10.0 | 10.0 |
| Konsistensi | 8.2 | 10.0 |
| Percobaan | 69/69 | 69/69 |
| Tes benar | ||
| Tingkat lulus per percobaan | 82.6% | 82.6% |
| Tes tidak stabil | 5 | 0 |
| Total Run | 69 | 69 |
| Biaya per hasil | 5.690 | 13.833 |
| Total Biaya | $0.911 | $2.629 |
| Harga input | $1.250 / 1M | $2.000 / 1M |
| Harga output | $4.250 / 1M | $6.000 / 1M |
| Total token input | 270,231 | 376,233 |
| Token output | 13,363 | 6,687 |
| Token penalaran | 121,332 | 305,927 |
| Waktu respons (rata-rata) | 17.73s | 87.48s |
| Waktu respons (maks) | 78.72s | 618.49s |
| Waktu respons (total) | 407.75s | 2012.15s |
| Parameter | ~1T total (~50B aktif) | ~1.7T total (~170B aktif) |
| Ketersediaan | Tertutup | Tertutup |
Showcase generasi model
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#65 Muse Spark 1.3
low- Biaya
- $0.017
- Waktu
- 83.9s
- Token
- 3,959 tok
#64 SpaceXAI: Grok 4.6
high- Biaya
- $0.107
- Waktu
- 265.1s
- Token
- 18,001 tok
Model teratas berdasarkan skor
Skor vs Total Biaya
Waktu respons (rata-rata)
Skor vs Waktu respons (rata-rata)
Total token output
Skor vs Total token output
Rincian Kategori
| Tugas agen | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.3 | 10.0 | 10.0 | 100.0% | 0 | 55.06s | 153,284 | 2,337 | 4,647 | |
| Grok 4.6 | 5.0 | 10.0 | 0.0% | 0 | 160.89s | 268,958 | 1,593 | 28,804 |
| Trik anti-AI | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.3 | 10.0 | 10.0 | 100.0% | 0 | 3.92s | 618 | 372 | 5,308 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 14.44s | 2,991 | 79 | 6,805 |
| Pemrograman | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.3 | 8.2 | 7.2 | 88.9% | 1 | 20.86s | 5,958 | 795 | 19,077 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 102.20s | 9,579 | 379 | 51,829 |
| Gabungan | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.3 | 7.3 | 5.8 | 83.3% | 1 | 25.72s | 90,340 | 6,828 | 14,390 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 91.77s | 68,548 | 3,931 | 34,529 |
| Parsing dan ekstraksi data | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.3 | 10.0 | 10.0 | 100.0% | 0 | 3.62s | 7,155 | 240 | 3,011 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 16.08s | 8,937 | 225 | 6,590 |
| Spesifik domain | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.3 | 3.5 | 4.4 | 33.3% | 2 | 45.63s | 738 | 1,083 | 48,809 | |
| Grok 4.6 | 5.3 | 10.0 | 33.3% | 0 | 369.95s | 2,523 | 14 | 154,471 |
| Kecerdasan umum | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.3 | 10.0 | 10.0 | 100.0% | 0 | 4.02s | 477 | 127 | 1,182 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 19.51s | 1,077 | 56 | 2,448 |
| Kepatuhan instruksi | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.3 | 9.8 | 10.0 | 100.0% | 0 | 5.04s | 669 | 189 | 3,025 | |
| Grok 4.6 | 9.8 | 10.0 | 100.0% | 0 | 13.82s | 1,857 | 57 | 4,318 |
| Pemecahan teka-teki | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.3 | 8.2 | 7.2 | 88.9% | 1 | 11.34s | 651 | 478 | 11,598 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 15.56s | 2,430 | 122 | 5,706 |
| Pemanggilan alat | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.3 | 10.0 | 10.0 | 100.0% | 0 | 7.39s | 10,158 | 603 | 2,074 | |
| Grok 4.6 | 10.0 | 10.0 | 100.0% | 0 | 13.30s | 8,544 | 216 | 1,505 |
| Pengetahuan umum | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Muse Spark 1.3 | 3.0 | 10.0 | 0.0% | 0 | 23.36s | 183 | 311 | 8,211 | |
| Grok 4.6 | 3.0 | 10.0 | 0.0% | 0 | 54.22s | 789 | 15 | 8,922 |
Perbandingan Cepat
Ganti Pasangan Perbandingan
Claude Sonnet 5mediumvsMuse Spark 1.3lowMuse Spark 1.3lowvsQwen3.7 MaxmediumClaude Sonnet 5mediumvsGrok 4.6highQwen3.7 MaxmediumvsGrok 4.6highQwen3.8 Max (0902)lowvsGrok 4.6highClaude Sonnet 5.5xhighvsGrok 4.6highMuse Spark 1.1lowvsGrok 4.6highClaude Sonnet 5.5highvsMuse Spark 1.3lowMuse Spark 1.3lowvsGPT-5 MinimediumClaude Sonnet 5.5xhighvsMuse Spark 1.3lowDeepSeek V4.1 FlashmaxvsGrok 4.6highQwen3.8 2.4T A95BlowvsGrok 4.6high