- Peringkat
- #53
- Total token output
- 430,816
- Waktu respons (rata-rata)
- 32.22s
- Total Biaya
- $0.272
DeepSeek V4.1 Flash (medium) vs Grok 4.5 (low)
DeepSeek V4.1 Flash (medium) unggul dalam skor rata-rata dengan 8.5 vs 8.4. DeepSeek V4.1 Flash (medium) memiliki biaya benchmark lebih rendah di $0.272 vs $0.945. Grok 4.5 (low) lebih cepat di 16.17s vs 32.22s, dengan tingkat keberhasilan 72.7% vs 77.3%.
Model yang Dibandingkan
- Peringkat
- #57
- Total token output
- 115,489
- Waktu respons (rata-rata)
- 16.17s
- Total Biaya
- $0.945
Model yang direkomendasikan
DeepSeek V4.1 Flash (medium)
It has the best score here (8.5), while costing about 3.5x less than Grok 4.5 (low).
Perbandingan terperinci
| Metrik | DeepSeek V4.1 Flash DeepSeek V4.1 Flash medium | Grok 4.5 Grok 4.5 low |
|---|---|---|
| Skor | 8.5 | 8.4 |
| Peringkat | #53 | #57 |
| Keandalan | 9.5 | 10.0 |
| Konsistensi | 9.3 | 9.3 |
| Percobaan | 66/66 | 66/66 |
| Tes benar | ||
| Tingkat lulus per percobaan | 72.7% | 77.3% |
| Tes tidak stabil | 2 | 2 |
| Total Run | 66 | 66 |
| Biaya per hasil | 1.812 | 5.901 |
| Total Biaya | $0.272 | $0.945 |
| Harga input | $0.150 / 1M | $2.000 / 1M |
| Harga output | $0.600 / 1M | $6.000 / 1M |
| Total token input | 88,508 | 125,605 |
| Token output | 5,410 | 7,505 |
| Token penalaran | 425,406 | 107,984 |
| Waktu respons (rata-rata) | 32.22s | 16.17s |
| Waktu respons (maks) | 276.31s | 205.28s |
| Waktu respons (total) | 708.76s | 355.67s |
| Parameter | 748B total (16B aktif) | ~1.7T total (~170B aktif) |
| Ketersediaan | Sumber terbuka | Tertutup |
Showcase generasi model
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#53 DeepSeek V4.1 Flash
medium- Biaya
- $0.014
- Waktu
- 34.7s
- Token
- 11,541 tok
#57 SpaceXAI: Grok 4.5
low- Biaya
- $0.011
- Waktu
- 12.4s
- Token
- 2,018 tok
Model teratas berdasarkan skor
Skor vs Total Biaya
Waktu respons (rata-rata)
Skor vs Waktu respons (rata-rata)
Total token output
Skor vs Total token output
Rincian Kategori
| Trik anti-AI | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 8.3 | 10.0 | 75.0% | 0 | 3.07s | 852 | 156 | 4,108 | |
| Grok 4.5 | 10.0 | 10.0 | 100.0% | 0 | 2.75s | 2,991 | 261 | 3,000 |
| Pemrograman | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 34.45s | 7,509 | 396 | 71,345 | |
| Grok 4.5 | 10.0 | 10.0 | 100.0% | 0 | 13.72s | 9,579 | 303 | 15,641 |
| Gabungan | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 22.21s | 66,161 | 3,956 | 24,673 | |
| Grok 4.5 | 6.5 | 10.0 | 50.0% | 0 | 12.75s | 82,028 | 6,031 | 3,583 |
| Parsing dan ekstraksi data | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 6.5 | 10.0 | 50.0% | 0 | 3.77s | 2,397 | 120 | 998 | |
| Grok 4.5 | 10.0 | 10.0 | 100.0% | 0 | 3.44s | 8,937 | 225 | 2,549 |
| Spesifik domain | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 2.9 | 7.2 | 11.1% | 1 | 153.01s | 909 | 24 | 298,454 | |
| Grok 4.5 | 2.9 | 7.2 | 11.1% | 1 | 77.09s | 2,523 | 14 | 71,813 |
| Kecerdasan umum | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 3.13s | 549 | 131 | 581 | |
| Grok 4.5 | 6.1 | 3.1 | 66.7% | 1 | 4.88s | 1,077 | 98 | 1,253 |
| Kepatuhan instruksi | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 9.69s | 783 | 63 | 1,483 | |
| Grok 4.5 | 9.8 | 10.0 | 100.0% | 0 | 2.80s | 1,857 | 57 | 1,878 |
| Pemecahan teka-teki | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 8.7 | 7.7 | 88.9% | 1 | 8.01s | 828 | 293 | 12,340 | |
| Grok 4.5 | 10.0 | 10.0 | 100.0% | 0 | 3.20s | 2,430 | 217 | 2,590 |
| Pemanggilan alat | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 10.0 | 10.0 | 100.0% | 0 | 15.33s | 8,259 | 258 | 296 | |
| Grok 4.5 | 10.0 | 10.0 | 100.0% | 0 | 5.83s | 13,394 | 284 | 871 |
| Pengetahuan umum | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 3.0 | 10.0 | 0.0% | 0 | 20.25s | 261 | 13 | 11,128 | |
| Grok 4.5 | 3.0 | 10.0 | 0.0% | 0 | 13.98s | 789 | 15 | 4,806 |
Perbandingan Cepat
Ganti Pasangan Perbandingan
GPT-5.2mediumvsGrok 4.5lowQwen3.8 27BhighvsGrok 4.5lowDeepSeek V4.1 FlashmediumvsMuse Spark 1.2lowSeed 2.1 TurbomediumvsGrok 4.5lowInkling SmallhighvsGrok 4.5lowDeepSeek V4.1 FlashmaxvsGrok 4.5lowDeepSeek V4.1 FlashhighvsGrok 4.5lowDeepSeek V4.1 FlashmediumvsQwen3.8 27BhighDeepSeek V4.1 FlashmediumvsQwen3.8 MaxlowDeepSeek V4.1 FlashmediumvsInkling SmallhighGPT-5.4mediumvsGrok 4.5lowClaude Fable 5.1mediumvsGrok 4.5low