Navigasi
AI BENCHY
Advertise here

Model yang Dibandingkan

Perbandingan benchmark Kimi K2.6 (medium) vs Kimi K2.5 (medium) vs GLM 5 (medium) vs Claude Opus 4.7 (medium): Claude Opus 4.7 (medium) unggul pada Skor dengan 8.7. Kimi K2.5 (medium) unggul pada Keandalan dengan 10.0. GLM 5 (medium) memiliki Total Biaya terendah di $0.307. Claude Opus 4.7 (medium) paling cepat di 7.61s.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-07-28

Peringkat
#78
Total token output
391,540
Waktu respons (rata-rata)
109.98s
Total Biaya
$0.831
Peringkat
#87
Total token output
227,367
Waktu respons (rata-rata)
99.00s
Total Biaya
$0.600
Peringkat
#50
Total token output
124,566
Waktu respons (rata-rata)
33.54s
Total Biaya
$0.307
Peringkat
#20
Total token output
29,990
Waktu respons (rata-rata)
7.61s
Total Biaya
$1.477
Model yang direkomendasikan Claude Opus 4.7 (medium)

It has the best score here (8.7), while responding about 10.6x faster than model lain dalam perbandingan ini.

Perbandingan terperinci

Metrik Kimi K2.6 Kimi K2.6 medium Rilis: 2026-04-20 Kimi K2.5 Kimi K2.5 medium Rilis: 2026-01-27 GLM 5 GLM 5 medium Rilis: 2026-02-12 Claude Opus 4.7 Claude Opus 4.7 medium Rilis: 2026-04-16
Skor 7.2 7.0 7.7 8.7
Peringkat #78 #87 #50 #20
Keandalan 9.4 10.0 10.0 10.0
Konsistensi 8.3 7.0 8.1 9.6
Tes benar
Tingkat lulus per percobaan 63.6% 65.2% 78.8% 83.3%
Tes tidak stabil 4 8 4 1
Total Run 66 66 63 66
Biaya per hasil 9.821 4.789 1.668 8.201
Total Biaya $0.831 $0.600 $0.307 $1.477
Harga input $0.646 / 1M $0.571 / 1M $0.950 / 1M $5.000 / 1M
Harga output $2.720 / 1M $2.850 / 1M $2.551 / 1M $25.000 / 1M
Total token input 68,902 118,448 35,224 145,252
Token output 111,680 62,124 21,570 24,948
Token penalaran 279,860 165,243 102,996 5,042
Waktu respons (rata-rata) 109.98s 99.00s 33.54s 7.61s
Waktu respons (maks) 876.20s 281.00s 99.85s 65.40s
Waktu respons (total) 2309.56s 1485.04s 435.99s 159.91s

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#78 MoonshotAI: Kimi K2.6

medium
Biaya
$0.013
Waktu
103.4s
Token
3,620 tok

#87 MoonshotAI: Kimi K2.5

medium
Biaya
$0.030
Waktu
58.6s
Token
8,683 tok

#50 GLM 5

medium
Biaya
$0.005
Waktu
20.7s
Token
2,068 tok

#20 Claude Opus 4.7

medium
Biaya
$0.059
Waktu
26.8s
Token
2,475 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Kimi K2.6 5.7 8.6 33.3% 0 214.42s 2,925 9,970 77,189
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693
GLM 5 10.0 10.0 100.0% 0 74.30s 7,254 2,997 52,930
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114

Perbandingan Cepat

Ganti Pasangan Perbandingan