Navigasi
AI BENCHY
Advertise here

Model yang Dibandingkan

Perbandingan benchmark GLM 5 (medium) vs GLM 5.1 (medium) vs Kimi K2.5 (medium) vs Qwen3.6 Plus Preview (medium): GLM 5 (medium) unggul pada Skor dengan 7.7. GLM 5 (medium) unggul pada Keandalan dengan 10.0. Qwen3.6 Plus Preview (medium) memiliki Total Biaya terendah di $0.000. Qwen3.6 Plus Preview (medium) paling cepat di 15.25s.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-07-25

Peringkat
#49
Total token output
124,566
Waktu respons (rata-rata)
33.54s
Total Biaya
$0.307
Peringkat
#82
Total token output
152,552
Waktu respons (rata-rata)
46.77s
Total Biaya
$0.535
Peringkat
#85
Total token output
227,367
Waktu respons (rata-rata)
99.00s
Total Biaya
$0.600
Peringkat
#190
Total token output
63,350
Waktu respons (rata-rata)
15.25s
Total Biaya
$0.000
Model yang direkomendasikan GLM 5 (medium)

It has the best score here (7.7), while costing about 1.8x less than model lain dalam perbandingan ini.

Perbandingan terperinci

Metrik GLM 5 GLM 5 medium Rilis: 2026-02-12 GLM 5.1 GLM 5.1 medium Rilis: 2026-04-07 Kimi K2.5 Kimi K2.5 medium Rilis: 2026-01-27 Qwen3.6 Plus Preview Qwen3.6 Plus Preview medium Rilis: 2026-04-20 Tersedia gratis
Skor 7.7 7.1 7.0 4.9
Peringkat #49 #82 #85 #190
Keandalan 10.0 8.3 10.0 T/A
Konsistensi 8.1 8.4 7.0 8.6
Tes benar
Tingkat lulus per percobaan 78.8% 69.7% 65.2% 40.9%
Tes tidak stabil 4 4 8 0
Total Run 63 66 66 57
Biaya per hasil 1.668 4.202 4.789 0.000
Total Biaya $0.307 $0.535 $0.600 $0.000
Harga input $0.950 / 1M $0.966 / 1M $0.571 / 1M $0.000 / 1M
Harga output $2.551 / 1M $3.036 / 1M $2.850 / 1M $0.000 / 1M
Total token input 35,224 82,623 118,448 32,639
Token output 21,570 16,089 62,124 1,153
Token penalaran 102,996 136,463 165,243 62,197
Waktu respons (rata-rata) 33.54s 46.77s 99.00s 15.25s
Waktu respons (maks) 99.85s 308.75s 281.00s 43.55s
Waktu respons (total) 435.99s 982.16s 1485.04s 182.96s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#49 GLM 5

medium
Biaya
$0.005
Waktu
20.7s
Token
2,068 tok

#82 GLM 5.1

medium
SVG tidak valid
Biaya
$0.000
Waktu
300.0s
Token
0 tok

#85 MoonshotAI: Kimi K2.5

medium
Biaya
$0.030
Waktu
58.6s
Token
8,683 tok

#190 Qwen3.6 Plus Preview

medium
Belum ada hasil showcase yang dihasilkan untuk model ini.
Biaya
$0.000
Waktu
-
Token
0 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
GLM 5 10.0 10.0 100.0% 0 74.30s 7,254 2,997 52,930
GLM 5.1 4.6 3.7 44.5% 2 109.63s 5,702 4,871 37,826
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693
Qwen3.6 Plus Preview 9.8 3.3 0.0% 0 0ms 0 0 0

Perbandingan Cepat

Ganti Pasangan Perbandingan