Navigasi
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Model yang Dibandingkan

Perbandingan benchmark Claude Opus 4.6 (medium) vs Claude Sonnet 4.6 (medium) vs GPT-5.3-Codex (medium) vs Gemini 3.1 Pro Preview (medium): Gemini 3.1 Pro Preview (medium) unggul pada Skor dengan 9.2. Claude Opus 4.6 (medium) unggul pada Keandalan dengan 10.0. GPT-5.3-Codex (medium) memiliki Total Biaya terendah di $0.920. GPT-5.3-Codex (medium) paling cepat di 16.96s.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-08-07

Peringkat
#60
Total token output
100,601
Waktu respons (rata-rata)
34.27s
Total Biaya
$3.059
Peringkat
#56
Total token output
115,865
Waktu respons (rata-rata)
25.91s
Total Biaya
$2.057
Peringkat
#18
Total token output
55,525
Waktu respons (rata-rata)
16.96s
Total Biaya
$0.920
Peringkat
#9
Total token output
97,958
Waktu respons (rata-rata)
21.47s
Total Biaya
$1.361
Model yang direkomendasikan GPT-5.3-Codex (medium)

Its score stays close to the best score here (8.9 vs 9.2), while costing about 2.3x less than model lain dalam perbandingan ini.

Perbandingan terperinci

Metrik Claude Opus 4.6 Claude Opus 4.6 medium Rilis: 2026-02-05 Claude Sonnet 4.6 Claude Sonnet 4.6 medium Rilis: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium Rilis: 2026-02-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Rilis: 2026-02-19
Skor 7.7 7.8 8.9 9.2
Peringkat #60 #56 #18 #9
Keandalan 10.0 10.0 10.0 10.0
Konsistensi 8.8 9.2 8.6 10.0
Cakupan benchmark 22/22 tes · 66/66 percobaan 22/22 tes · 66/66 percobaan 22/22 tes · 66/66 percobaan 22/22 tes · 66/66 percobaan
Tes benar
Tingkat lulus per percobaan 63.6% 66.7% 83.3% 90.9%
Tes tidak stabil 3 2 4 0
Total Run 66 66 66 66
Biaya per hasil 23.524 14.692 5.748 6.801
Total Biaya $3.059 $2.057 $0.920 $1.361
Harga input $5.000 / 1M $3.000 / 1M $1.750 / 1M $2.000 / 1M
Harga output $25.000 / 1M $15.000 / 1M $14.000 / 1M $12.000 / 1M
Total token input 108,615 106,292 81,268 92,287
Token output 72,286 80,748 6,251 5,232
Token penalaran 28,315 35,117 49,274 92,726
Waktu respons (rata-rata) 34.27s 25.91s 16.96s 21.47s
Waktu respons (maks) 151.51s 140.96s 100.93s 88.68s
Waktu respons (total) 513.99s 362.78s 373.19s 322.08s

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#60 Claude Opus 4.6

medium
SVG tidak valid
Biaya
$0.000
Waktu
300.0s
Token
0 tok

#56 Claude Sonnet 4.6

medium
SVG tidak valid
Biaya
$0.000
Waktu
300.0s
Token
0 tok

#18 GPT-5.3-Codex

medium
Biaya
$0.049
Waktu
54.9s
Token
3,580 tok

#9 Gemini 3.1 Pro Preview

medium
Biaya
$0.115
Waktu
87.2s
Token
9,629 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247

Perbandingan Cepat

Ganti Pasangan Perbandingan