Navigasi
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (low) vs Qwen3.5-Flash (medium)

Qwen3.5-Flash (medium) unggul dalam skor rata-rata dengan 6.1 vs 6.0. Qwen3.5-Flash (medium) memiliki biaya benchmark lebih rendah di $0.142 vs $0.658. Qwen3.5-Flash (medium) lebih cepat di 84.44s vs 96.61s, dengan tingkat keberhasilan 47.0% vs 65.2%.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-08-14

Peringkat
#174
Total token output
818,359
Waktu respons (rata-rata)
96.61s
Total Biaya
$0.658
Peringkat
#167
Total token output
512,846
Waktu respons (rata-rata)
84.44s
Total Biaya
$0.142
Model yang direkomendasikan Qwen3.5-Flash (medium)

It has the best score here (6.1), while costing about 4.7x less than Trinity Large Thinking (low).

Perbandingan terperinci

Metrik Trinity Large Thinking Trinity Large Thinking low Rilis: 2026-07-28 Qwen3.5-Flash Qwen3.5-Flash medium Rilis: 2026-02-24
Skor 6.0 6.1
Peringkat #174 #167
Keandalan 10.0 10.0
Konsistensi 8.3 7.8
Percobaan 66/66 66/66
Tes benar
Tingkat lulus per percobaan 47.0% 65.2%
Tes tidak stabil 5 6
Total Run 66 66
Biaya per hasil 8.221 1.491
Total Biaya $0.658 $0.142
Harga input $0.220 / 1M $0.065 / 1M
Harga output $0.850 / 1M $0.260 / 1M
Total token input 122,854 118,508
Token output 119,810 35,457
Token penalaran 698,549 477,389
Waktu respons (rata-rata) 96.61s 84.44s
Waktu respons (maks) 540.96s 515.38s
Waktu respons (total) 2125.51s 1773.20s
Parameter 398B total (13B aktif) ~35B total (~3B aktif)
Ketersediaan Bobot tersedia Tertutup

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#174 Trinity Large Thinking

low
Biaya
$0.021
Waktu
173.2s
Token
24,586 tok

#167 Qwen3.5-Flash

medium
Biaya
$0.002
Waktu
25.8s
Token
4,294 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Trinity Large Thinking 5.3 10.0 33.3% 0 344.45s 5,441 27,039 217,241
Qwen3.5-Flash 3.7 7.2 22.2% 1 58.87s 6,685 302 90,081

Perbandingan Cepat

Ganti Pasangan Perbandingan