Navigasi
Advertise here

Trinity Large Thinking (high) vs Qwen3.8 Flash Next

Qwen3.8 Flash Next unggul dalam skor rata-rata dengan 5.8 vs 5.7. Qwen3.8 Flash Next memiliki biaya benchmark lebih rendah di ~$0.011 vs $0.794. Qwen3.8 Flash Next lebih cepat di 5.71s vs 74.52s, dengan tingkat keberhasilan 42.0% vs 43.5%.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-10-05

Model yang Dibandingkan

Peringkat
#263
Total token output
943,044
Waktu respons (rata-rata)
74.52s
Total Biaya
$0.794
Peringkat
#258
Total token output
9,077
Waktu respons (rata-rata)
5.71s
Total Biaya
~$0.011
Model yang direkomendasikan Qwen3.8 Flash Next

It has the best score here (5.8), while costing about 73.3x less than Trinity Large Thinking (high).

Perbandingan terperinci

Metrik Trinity Large Thinking Trinity Large Thinking high Rilis: 2026-07-28 Qwen3.8 Flash Next Qwen3.8 Flash Next none Rilis: 2026-10-04
Skor 5.7 5.8
Peringkat #263 #258
Keandalan 10.0 10.0
Konsistensi 7.3 9.0
Percobaan 69/69 69/69
Tes benar
Tingkat lulus per percobaan 42.0% 43.5%
Tes tidak stabil 8 3
Total Run 69 69
Biaya per hasil 11.289 ~0.136
Total Biaya $0.794 ~$0.011
Harga input $0.250 / 1M T/A
Harga output $0.800 / 1M T/A
Harga baca cache $0.060 / 1M T/A
Harga tulis cache T/A T/A
Total token input 283,116 266,004
Token output 277,920 9,077
Token penalaran 665,124 0
Waktu respons (rata-rata) 74.52s 5.71s
Waktu respons (maks) 510.21s 65.25s
Waktu respons (total) 1713.90s 131.36s
Parameter 398B total (13B aktif) 180B total (6B aktif)
Ketersediaan Bobot tersedia Bobot tersedia

Harga cache berlaku untuk token input. Pembacaan memakai kembali prompt tersimpan; penulisan menyimpannya dan dapat menambah biaya. Token output menggunakan harga output.

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#263 Trinity Large Thinking

high
Biaya
$0.028
Waktu
130.1s
Token
34,387 tok

#258 Qwen3.8 Flash Next

none
Biaya
~$0.001
Waktu
27.5s
Token
2,983 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Trinity Large Thinking 3.7 4.7 33.3% 2 245.04s 7,204 83,616 266,836
Qwen3.8 Flash Next 5.5 10.0 33.3% 0 1.64s 7,911 669 0

Perbandingan Cepat

Ganti Pasangan Perbandingan