Navigasi
AI BENCHY
Advertise here

Trinity Large Thinking (medium) vs Seed 2.1 Turbo

Trinity Large Thinking (medium) unggul dalam skor rata-rata dengan 6.0 vs 5.7. Seed 2.1 Turbo memiliki biaya benchmark lebih rendah di $0.092 vs $0.792. Seed 2.1 Turbo lebih cepat di 6.85s vs 84.96s, dengan tingkat keberhasilan 45.5% vs 50.0%.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-08-12

Peringkat
#179
Total token output
1,002,646
Waktu respons (rata-rata)
84.96s
Total Biaya
$0.792
Peringkat
#187
Total token output
10,640
Waktu respons (rata-rata)
6.85s
Total Biaya
$0.092
Model yang direkomendasikan Seed 2.1 Turbo

Its score stays close to the best score here (5.7 vs 6.0), while costing about 8.7x less than Trinity Large Thinking (medium).

Perbandingan terperinci

Metrik Trinity Large Thinking Trinity Large Thinking medium Rilis: 2026-07-28 Seed 2.1 Turbo Seed 2.1 Turbo none Rilis: 2026-08-12
Skor 6.0 5.7
Peringkat #179 #187
Keandalan 10.0 10.0
Konsistensi 7.6 8.9
Percobaan 66/66 66/66
Tes benar
Tingkat lulus per percobaan 45.5% 50.0%
Tes tidak stabil 7 3
Total Run 66 66
Biaya per hasil 11.308 1.014
Total Biaya $0.792 $0.092
Harga input $0.220 / 1M $0.500 / 1M
Harga output $0.850 / 1M $2.500 / 1M
Total token input 118,477 129,141
Token output 148,823 10,640
Token penalaran 853,823 0
Waktu respons (rata-rata) 84.96s 6.85s
Waktu respons (maks) 525.14s 55.92s
Waktu respons (total) 1869.16s 150.66s
Parameter 398B total (13B aktif) ~200B total (~20B aktif)
Ketersediaan Bobot tersedia Tertutup

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#179 Trinity Large Thinking

medium
Biaya
$0.016
Waktu
75.9s
Token
19,401 tok

#187 Seed 2.1 Turbo

none
Biaya
$0.093
Waktu
517.1s
Token
37,102 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Trinity Large Thinking 7.5 10.0 66.7% 0 179.02s 7,248 7,413 351,155
Seed 2.1 Turbo 4.5 7.9 22.2% 1 2.35s 8,211 608 0

Perbandingan Cepat

Ganti Pasangan Perbandingan