- Peringkat
- #119
- Total token output
- 714,287
- Waktu respons (rata-rata)
- 300.15s
- Total Biaya
- $1.648
Mistral Large 4 (low) vs GPT-6 Luna (low)
Skor rata-rata hampir imbang di 7.6 vs 7.6. GPT-6 Luna (low) memiliki biaya benchmark lebih rendah di $0.033 vs $1.648. GPT-6 Luna (low) lebih cepat di 23.23s vs 300.15s, dengan tingkat keberhasilan 65.2% vs 63.8%.
Model yang Dibandingkan
- Peringkat
- #121
- Total token output
- 24,880
- Waktu respons (rata-rata)
- 23.23s
- Total Biaya
- $0.033
Model yang direkomendasikan
GPT-6 Luna (low)
It has the best score here (7.6), while costing about 51.4x less than Mistral Large 4 (low).
Perbandingan terperinci
| Metrik | Mistral Large 4 Mistral Large 4 low | GPT-6 Luna GPT-6 Luna low |
|---|---|---|
| Skor | 7.6 | 7.6 |
| Peringkat | #119 | #121 |
| Keandalan | 9.0 | 9.7 |
| Konsistensi | 8.7 | 8.5 |
| Percobaan | 69/69 | 69/69 |
| Tes benar | ||
| Tingkat lulus per percobaan | 65.2% | 63.8% |
| Tes tidak stabil | 4 | 4 |
| Total Run | 69 | 69 |
| Biaya per hasil | 12.670 | 0.267 |
| Total Biaya | $1.648 | $0.033 |
| Harga input | $0.680 / 1M | $0.100 / 1M |
| Harga output | $2.090 / 1M | $0.500 / 1M |
| Harga baca cache | $0.070 / 1M | $0.010 / 1M |
| Harga tulis cache | T/A | $0.125 / 1M |
| Total token input | 226,734 | 195,928 |
| Token output | 278,013 | 5,728 |
| Token penalaran | 638,296 | 19,152 |
| Waktu respons (rata-rata) | 300.15s | 23.23s |
| Waktu respons (maks) | 1798.01s | 89.37s |
| Waktu respons (total) | 6903.40s | 534.22s |
| Parameter | 1.05T total (49B aktif) | ~400B total (~17B aktif) |
| Ketersediaan | Tertutup | Tertutup |
Harga cache berlaku untuk token input. Pembacaan memakai kembali prompt tersimpan; penulisan menyimpannya dan dapat menambah biaya. Token output menggunakan harga output.
Showcase generasi model
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#119 Mistral Large 4
low- Biaya
- $0.015
- Waktu
- 115.1s
- Token
- 6,915 tok
#121 GPT-6 Luna
low- Biaya
- $0.002
- Waktu
- 19.2s
- Token
- 2,598 tok
Model teratas berdasarkan skor
Skor vs Total Biaya
Waktu respons (rata-rata)
Skor vs Waktu respons (rata-rata)
Total token output
Skor vs Total token output
Rincian Kategori
| Tugas agen | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Mistral Large 4 | 10.0 | 10.0 | 100.0% | 0 | 69.63s | 143,243 | 3,788 | 3,053 | |
| GPT-6 Luna | 10.0 | 10.0 | 100.0% | 0 | 51.03s | 115,769 | 1,105 | 1,170 |
| Trik anti-AI | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Mistral Large 4 | 8.3 | 10.0 | 75.0% | 0 | 19.75s | 705 | 999 | 9,354 | |
| GPT-6 Luna | 6.9 | 7.9 | 66.7% | 1 | 11.00s | 554 | 130 | 704 |
| Pemrograman | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Mistral Large 4 | 3.4 | 7.2 | 22.2% | 1 | 1379.72s | 5,896 | 129,426 | 386,126 | |
| GPT-6 Luna | 6.0 | 7.2 | 55.6% | 1 | 15.39s | 7,302 | 493 | 6,655 |
| Gabungan | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Mistral Large 4 | 10.0 | 10.0 | 100.0% | 0 | 556.27s | 60,360 | 5,603 | 60,531 | |
| GPT-6 Luna | 7.3 | 5.8 | 83.3% | 1 | 49.77s | 57,227 | 3,023 | 2,271 |
| Parsing dan ekstraksi data | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Mistral Large 4 | 10.0 | 10.0 | 100.0% | 0 | 27.46s | 7,314 | 1,014 | 7,623 | |
| GPT-6 Luna | 10.0 | 10.0 | 100.0% | 0 | 9.94s | 7,140 | 234 | 250 |
| Spesifik domain | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Mistral Large 4 | 2.9 | 7.2 | 11.1% | 1 | 291.62s | 798 | 82,605 | 111,098 | |
| GPT-6 Luna | 5.3 | 10.0 | 33.3% | 0 | 18.09s | 628 | 62 | 5,990 |
| Kecerdasan umum | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Mistral Large 4 | 10.0 | 10.0 | 100.0% | 0 | 39.29s | 516 | 5,529 | 5,865 | |
| GPT-6 Luna | 4.4 | 9.9 | 0.0% | 0 | 1.46s | 477 | 102 | 0 |
| Kepatuhan instruksi | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Mistral Large 4 | 8.4 | 6.9 | 83.3% | 1 | 23.21s | 708 | 5,408 | 6,402 | |
| GPT-6 Luna | 7.1 | 5.8 | 83.3% | 1 | 17.38s | 540 | 84 | 250 |
| Pemecahan teka-teki | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Mistral Large 4 | 7.7 | 7.3 | 77.8% | 1 | 35.82s | 717 | 8,012 | 9,030 | |
| GPT-6 Luna | 7.7 | 10.0 | 66.7% | 0 | 27.45s | 642 | 213 | 1,272 |
| Pemanggilan alat | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Mistral Large 4 | 10.0 | 10.0 | 100.0% | 0 | 21.53s | 6,267 | 307 | 1,015 | |
| GPT-6 Luna | 10.0 | 10.0 | 100.0% | 0 | 71.65s | 5,454 | 254 | 152 |
| Pengetahuan umum | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Mistral Large 4 | 3.0 | 10.0 | 0.0% | 0 | 358.62s | 210 | 35,322 | 38,199 | |
| GPT-6 Luna | 3.0 | 10.0 | 0.0% | 0 | 29.10s | 195 | 28 | 438 |
Perbandingan Cepat
Ganti Pasangan Perbandingan
GPT-6 LunalowvsQwen3.8 Flash NextmediumGPT-6 LunalowvsSpace Bunny AlphahighMistral Large 4lowvsQwen3.8 Flash NextmediumGPT-6 LunalowvsGLM 5.1mediumSeed-2.0-MinimediumvsGPT-6 LunalowMistral Large 4lowvsSpace Bunny AlphahighMistral Large 4lowvsGLM 5.1mediumMistral Large 4highvsGPT-6 LunalowSeed-2.0-MinimediumvsMistral Large 4lowMuse Glimmer 30BmediumvsMistral Large 4lowSeed-2.0-CodehighvsGPT-6 LunalowMistral Large 4lowvsQwen3.5 Plus 2026-04-20medium