Navigasi
Advertise here

Model yang Dibandingkan

Perbandingan benchmark Claude Opus 5 (high) vs GPT-5.6 Sol (high) vs Kimi K3 (max) vs Gemini 3.6 Flash (medium): Gemini 3.6 Flash (medium) unggul pada Skor dengan 9.8. Claude Opus 5 (high) unggul pada Keandalan dengan 10.0. Gemini 3.6 Flash (medium) memiliki Total Biaya terendah di $0.427. GPT-5.6 Sol (high) paling cepat di 11.48s.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-09-10

Model yang Dibandingkan

Peringkat
#20
Total token output
95,583
Waktu respons (rata-rata)
22.51s
Total Biaya
$3.070
Peringkat
#15
Total token output
28,708
Waktu respons (rata-rata)
11.48s
Total Biaya
$0.446
Peringkat
#78
Total token output
224,128
Waktu respons (rata-rata)
142.84s
Total Biaya
$3.467
Peringkat
#7
Total token output
100,876
Waktu respons (rata-rata)
11.86s
Total Biaya
$0.427
Model yang direkomendasikan Gemini 3.6 Flash (medium)

It has the best score here (9.8), while costing about 5.5x less than model lain dalam perbandingan ini.

Perbandingan terperinci

Metrik Claude Opus 5 Claude Opus 5 high Rilis: 2026-07-25 GPT-5.6 Sol GPT-5.6 Sol high Rilis: 2026-07-09 Kimi K3 Kimi K3 max Rilis: 2026-07-16 Gemini 3.6 Flash Gemini 3.6 Flash medium Rilis: 2026-07-21
Skor 9.2 9.4 7.9 9.8
Peringkat #20 #15 #78 #7
Keandalan 10.0 10.0 9.0 10.0
Konsistensi 10.0 8.9 9.2 9.2
Percobaan 66/66 66/66 66/66 66/66
Tes benar
Tingkat lulus per percobaan 81.8% 89.4% 77.3% 95.5%
Tes tidak stabil 0 3 2 2
Total Run 66 66 66 66
Biaya per hasil 17.052 6.987 21.668 4.101
Total Biaya $3.070 $0.446 $3.467 $0.427
Harga input $5.000 / 1M $2.000 / 1M $3.000 / 1M $0.750 / 1M
Harga output $25.000 / 1M $10.000 / 1M $15.000 / 1M $3.750 / 1M
Total token input 135,956 79,258 34,960 64,446
Token output 64,624 4,855 2,887 1,974
Token penalaran 30,959 23,853 221,241 98,902
Waktu respons (rata-rata) 22.51s 11.48s 142.84s 11.86s
Waktu respons (maks) 159.01s 54.79s 766.58s 77.15s
Waktu respons (total) 495.12s 252.62s 2714.02s 260.96s
Parameter ~5T total (~500B aktif) ~2T total (~150B aktif) 2.8T total (104B aktif) ~500B total (~20B aktif)
Ketersediaan Tertutup Tertutup Bobot tersedia Tertutup

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#20 Claude Opus 5

high
Biaya
$0.265
Waktu
144.5s
Token
10,741 tok

#15 GPT-5.6 Sol

high
Biaya
$0.151
Waktu
201.9s
Token
5,100 tok

#78 MoonshotAI: Kimi K3

max
Biaya
$0.281
Waktu
506.9s
Token
18,863 tok

#7 Gemini 3.6 Flash

medium
Biaya
$0.095
Waktu
49.9s
Token
12,664 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Claude Opus 5 10.0 10.0 100.0% 0 12.73s 10,590 7,547 1,721
GPT-5.6 Sol 10.0 10.0 100.0% 0 12.52s 7,302 404 5,656
Kimi K3 10.0 10.0 100.0% 0 325.79s 8,061 460 84,012
Gemini 3.6 Flash 10.0 10.0 100.0% 0 14.81s 8,124 444 31,421

Perbandingan Cepat

Ganti Pasangan Perbandingan