Navigasi
Advertise here

Trinity Large Thinking (high) vs GPT-5.4

Trinity Large Thinking (high) unggul dalam skor rata-rata dengan 5.7 vs 5.6. Trinity Large Thinking (high) memiliki biaya benchmark lebih rendah di $0.645 vs $0.690. GPT-5.4 lebih cepat di 3.89s vs 74.52s, dengan tingkat keberhasilan 42.0% vs 33.3%.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-10-01

Model yang Dibandingkan

Peringkat
#253
Total token output
943,044
Waktu respons (rata-rata)
74.52s
Total Biaya
$0.645
Peringkat
#260
Total token output
9,372
Waktu respons (rata-rata)
3.89s
Total Biaya
$0.690
Model yang direkomendasikan GPT-5.4

Its score stays close to the best score here (5.6 vs 5.7), while responding about 19.2x faster than Trinity Large Thinking (high).

Perbandingan terperinci

Metrik Trinity Large Thinking Trinity Large Thinking high Rilis: 2026-07-28 GPT-5.4 GPT-5.4 none Rilis: 2026-03-05
Skor 5.7 5.6
Peringkat #253 #260
Keandalan 10.0 10.0
Konsistensi 7.3 9.3
Percobaan 69/69 69/69
Tes benar
Tingkat lulus per percobaan 42.0% 33.3%
Tes tidak stabil 8 2
Total Run 69 69
Biaya per hasil 11.289 9.845
Total Biaya $0.645 $0.690
Harga input $0.250 / 1M $2.500 / 1M
Harga output $0.800 / 1M $15.000 / 1M
Total token input 283,116 219,404
Token output 277,920 9,372
Token penalaran 665,124 0
Waktu respons (rata-rata) 74.52s 3.89s
Waktu respons (maks) 510.21s 43.73s
Waktu respons (total) 1713.90s 89.48s
Parameter 398B total (13B aktif) ~1.5T total (~100B aktif)
Ketersediaan Bobot tersedia Tertutup

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#253 Trinity Large Thinking

high
Biaya
$0.028
Waktu
130.1s
Token
34,387 tok

#260 GPT-5.4

none
Biaya
$0.026
Waktu
18.1s
Token
1,792 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Trinity Large Thinking 3.7 4.7 33.3% 2 245.04s 7,204 83,616 266,836
GPT-5.4 5.5 10.0 33.3% 0 1.62s 7,305 516 0

Perbandingan Cepat

Ganti Pasangan Perbandingan