- Peringkat
- #18
- Total token output
- 97,238
- Waktu respons (rata-rata)
- 20.62s
- Total Biaya
- $1.352
Gemini 3.1 Pro Preview (medium) vs Qwen3.8 Max (0902) (low)
Gemini 3.1 Pro Preview (medium) unggul dalam skor rata-rata dengan 9.2 vs 9.1. Qwen3.8 Max (0902) (low) memiliki biaya benchmark lebih rendah di $0.664 vs $1.352. Gemini 3.1 Pro Preview (medium) lebih cepat di 20.62s vs 24.21s, dengan tingkat keberhasilan 90.9% vs 86.4%.
- Peringkat
- #23
- Total token output
- 75,865
- Waktu respons (rata-rata)
- 24.21s
- Total Biaya
- $0.664
Model yang direkomendasikan
Qwen3.8 Max (0902) (low)
Its score stays close to the best score here (9.1 vs 9.2), while costing about 2.0x less than Gemini 3.1 Pro Preview (medium).
Perbandingan terperinci
| Metrik | Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium | Qwen3.8 Max (0902) Qwen3.8 Max (0902) low |
|---|---|---|
| Skor | 9.2 | 9.1 |
| Peringkat | #18 | #23 |
| Keandalan | 10.0 | 10.0 |
| Konsistensi | 10.0 | 9.3 |
| Percobaan | 66/66 | 66/66 |
| Tes benar | ||
| Tingkat lulus per percobaan | 90.9% | 86.4% |
| Tes tidak stabil | 0 | 2 |
| Total Run | 66 | 66 |
| Biaya per hasil | 6.758 | 3.684 |
| Total Biaya | $1.352 | $0.664 |
| Harga input | $2.000 / 1M | $2.000 / 1M |
| Harga output | $12.000 / 1M | $6.000 / 1M |
| Total token input | 92,296 | 103,954 |
| Token output | 5,232 | 6,322 |
| Token penalaran | 92,006 | 69,543 |
| Waktu respons (rata-rata) | 20.62s | 24.21s |
| Waktu respons (maks) | 88.68s | 207.79s |
| Waktu respons (total) | 329.94s | 532.62s |
| Parameter | ~1.2T total (~20B aktif) | 2.4T total (~100B aktif) |
| Ketersediaan | Tertutup | Tertutup |
Showcase generasi model
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#18 Gemini 3.1 Pro Preview
medium- Biaya
- $0.115
- Waktu
- 87.2s
- Token
- 9,629 tok
#23 Qwen3.8 Max (0902)
low- Biaya
- $0.014
- Waktu
- 41.2s
- Token
- 2,421 tok
Model teratas berdasarkan skor
Skor vs Total Biaya
Waktu respons (rata-rata)
Skor vs Waktu respons (rata-rata)
Total token output
Skor vs Total token output
Rincian Kategori
| Trik anti-AI | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 7.90s | 498 | 112 | 3,218 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.72s | 984 | 212 | 1,854 |
| Pemrograman | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 7.9 | 9.9 | 66.7% | 0 | 40.17s | 8,124 | 435 | 41,247 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 37.42s | 8,127 | 485 | 17,404 |
| Gabungan | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 9.8 | 10.0 | 100.0% | 0 | 40.39s | 67,910 | 3,687 | 23,111 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 113.88s | 74,767 | 4,562 | 29,335 |
| Parsing dan ekstraksi data | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 7.72s | 7,265 | 279 | 3,904 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 9.94s | 7,938 | 261 | 2,254 |
| Spesifik domain | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 7.7 | 10.0 | 66.7% | 0 | 20.29s | 644 | 18 | 11,704 | |
| Qwen3.8 Max (0902) | 5.3 | 7.2 | 44.4% | 1 | 34.93s | 1,014 | 45 | 13,881 |
| Kecerdasan umum | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 11.77s | 490 | 108 | 1,179 | |
| Qwen3.8 Max (0902) | 6.1 | 3.1 | 66.7% | 1 | 8.91s | 594 | 120 | 820 |
| Kepatuhan instruksi | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 9.56s | 621 | 72 | 2,236 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.32s | 855 | 90 | 866 |
| Pemecahan teka-teki | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 6.90s | 570 | 235 | 3,128 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.49s | 930 | 275 | 1,248 |
| Pemanggilan alat | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 23.15s | 6,018 | 274 | 982 | |
| Qwen3.8 Max (0902) | 10.0 | 10.0 | 100.0% | 0 | 4.73s | 8,463 | 249 | 126 |
| Pengetahuan umum | Skor | Konsistensi | Tingkat lulus per percobaan | Tes tidak stabil | Tes benar | Waktu respons (rata-rata) | Token input | Token output | Token penalaran |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 10.0 | 10.0 | 100.0% | 0 | 6.27s | 156 | 12 | 1,297 | |
| Qwen3.8 Max (0902) | 3.0 | 10.0 | 0.0% | 0 | 13.28s | 282 | 23 | 1,755 |
Perbandingan Cepat
Ganti Pasangan Perbandingan
Gemini 3.8 FlashmediumvsQwen3.8 Max (0902)lowClaude Opus 5highvsGemini 3.1 Pro PreviewmediumGemini 3.1 Pro PreviewmediumvsGrok 4.6highGemini 3.1 Pro PreviewmediumvsGPT-5.5lowClaude Opus 5mediumvsQwen3.8 Max (0902)lowClaude Opus 5highvsQwen3.8 Max (0902)lowClaude Fable 5.1highvsQwen3.8 Max (0902)lowGemini 3.1 Pro PreviewmediumvsGPT-5.6 SolhighGemini 3.5 FlashmediumvsQwen3.8 Max (0902)lowGPT-5.5mediumvsQwen3.8 Max (0902)lowSeed 2.1 TurbolowvsGemini 3.1 Pro PreviewmediumQwen3.8 Max (0902)lowvsGrok 4.5high