Navigasi
AI BENCHY
AD
Track all your projects in one dashboard. Get ๐Ÿ“Šstats, ๐Ÿ”ฅheatmaps and ๐Ÿ‘€recordings in one self-hosted dashboard.
uxwizz.com

Model yang Dibandingkan

Perbandingan benchmark Claude Opus 5 (high) vs GPT-5.6 Sol (high) vs Kimi K3 (max) vs Gemini 3.6 Flash (medium)Gemini 3.6 Flash (medium) unggul pada Skor dengan 9.9. Claude Opus 5 (high) unggul pada Keandalan dengan 10.0. Gemini 3.6 Flash (medium) memiliki Total Biaya terendah di $0.831. Gemini 3.6 Flash (medium) paling cepat di 10.11s.

Model yang direkomendasikanGemini 3.6 Flash (medium)It has the best score here (9.9), while costing about 2.9x less than model lain dalam perbandingan ini.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-07-25

Metrik Claude Opus 5 Claude Opus 5 high Rilis: 2026-07-25 GPT-5.6 Sol GPT-5.6 Sol high Rilis: 2026-07-09 Kimi K3 Kimi K3 max Rilis: 2026-07-16 Gemini 3.6 Flash Gemini 3.6 Flash medium Rilis: 2026-07-21
Skor 9.2 9.4 8.0 9.9
Peringkat #11 #8 #40 #1
Keandalan 10.0 10.0 9.1 10.0
Konsistensi 9.6 8.9 9.5 9.6
Tes benar
Tingkat lulus per percobaan 84.9% 89.4% 75.8% 98.5%
Tes tidak stabil 1 3 1 1
Total Run 66 66 66 66
Biaya per hasil 15.747 6.852 19.446 3.955
Total Biaya $2.835 $1.234 $3.112 $0.831
Harga input $5.000 / 1M $5.000 / 1M $3.000 / 1M $1.500 / 1M
Harga output $25.000 / 1M $30.000 / 1M $15.000 / 1M $7.500 / 1M
Total token input 135,959 79,249 34,916 66,293
Token output 67,066 4,855 2,910 2,000
Token penalaran 19,114 23,044 197,529 95,464
Waktu respons (rata-rata) 20.44s 11.73s 122.48s 10.11s
Waktu respons (maks) 159.01s 54.79s 766.58s 68.03s
Waktu respons (total) 449.68s 257.99s 2327.06s 222.33s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#11 Claude Opus 5

high
Biaya
$0.265
Waktu
144.5s
Token
10,741 tok

#8 GPT-5.6 Sol

high
Biaya
$0.151
Waktu
201.9s
Token
5,100 tok

#40 MoonshotAI: Kimi K3

max
Biaya
$0.281
Waktu
506.9s
Token
18,863 tok

#1 Gemini 3.6 Flash

medium
Biaya
$0.079
Waktu
47.9s
Token
10,532 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Claude Opus 5 10.0 10.0 100.0% 0 12.73s 10,590 7,547 1,721
GPT-5.6 Sol 10.0 10.0 100.0% 0 12.52s 7,302 404 5,656
Kimi K3 10.0 10.0 100.0% 0 325.79s 8,061 460 84,012
Gemini 3.6 Flash 10.0 10.0 100.0% 0 17.49s 8,136 474 40,157

Perbandingan Cepat

Ganti Pasangan Perbandingan