Navigasi
AI BENCHY
Advertise here

GPT-5.6 Sol vs Qwen3.7 Flash (medium)

Skor rata-rata hampir imbang di 6.9 vs 7.0. Qwen3.7 Flash (medium) memiliki biaya benchmark lebih rendah di $0.064 vs $0.524. GPT-5.6 Sol lebih cepat di 2.16s vs 45.90s, dengan tingkat keberhasilan 59.1% vs 65.2%.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-07-28

Peringkat
#94
Total token output
4,357
Waktu respons (rata-rata)
2.16s
Total Biaya
$0.524
Peringkat
#91
Total token output
462,623
Waktu respons (rata-rata)
45.90s
Total Biaya
$0.064
Model yang direkomendasikan Qwen3.7 Flash (medium)

It has the best score here (7.0), while costing about 8.2x less than GPT-5.6 Sol.

Perbandingan terperinci

Metrik GPT-5.6 Sol GPT-5.6 Sol none Rilis: 2026-07-09 Qwen3.7 Flash Qwen3.7 Flash medium Rilis: 2026-07-28
Skor 6.9 7.0
Peringkat #94 #91
Keandalan 10.0 10.0
Konsistensi 9.0 7.5
Tes benar
Tingkat lulus per percobaan 59.1% 65.2%
Tes tidak stabil 3 7
Total Run 66 66
Biaya per hasil 4.761 0.636
Total Biaya $0.524 $0.064
Harga input $5.000 / 1M $0.030 / 1M
Harga output $30.000 / 1M $0.130 / 1M
Total token input 78,593 114,468
Token output 4,357 12,786
Token penalaran 0 449,837
Waktu respons (rata-rata) 2.16s 45.90s
Waktu respons (maks) 12.81s 593.64s
Waktu respons (total) 47.62s 1009.84s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#94 GPT-5.6 Sol

none
Biaya
$0.116
Waktu
78.7s
Token
3,944 tok

#91 Qwen3.7 Flash

medium
SVG tidak valid
Biaya
$0.000
Waktu
600.0s
Token
0 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
GPT-5.6 Sol 5.5 10.0 33.3% 0 1.39s 7,302 390 0
Qwen3.7 Flash 6.2 6.9 55.6% 1 46.78s 7,893 563 61,902

Perbandingan Cepat

Ganti Pasangan Perbandingan