Navigasi
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (medium) vs Gemini 3.1 Flash Lite (minimal)

Skor rata-rata hampir imbang di 6.1 vs 6.1. Gemini 3.1 Flash Lite (minimal) memiliki biaya benchmark lebih rendah di $0.047 vs $0.798. Gemini 3.1 Flash Lite (minimal) lebih cepat di 1.85s vs 85.44s, dengan tingkat keberhasilan 48.5% vs 51.5%.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-08-14

Peringkat
#169
Total token output
1,016,785
Waktu respons (rata-rata)
85.44s
Total Biaya
$0.798
Peringkat
#162
Total token output
11,118
Waktu respons (rata-rata)
1.85s
Total Biaya
$0.047
Model yang direkomendasikan Gemini 3.1 Flash Lite (minimal)

It has the best score here (6.1), while costing about 17.2x less than Trinity Large Thinking (medium).

Perbandingan terperinci

Metrik Trinity Large Thinking Trinity Large Thinking medium Rilis: 2026-07-28 Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite minimal Rilis: 2026-05-08
Skor 6.1 6.1
Peringkat #169 #162
Keandalan 10.0 10.0
Konsistensi 7.9 8.9
Percobaan 66/66 66/66
Tes benar
Tingkat lulus per percobaan 48.5% 51.5%
Tes tidak stabil 6 3
Total Run 66 66
Biaya per hasil 9.972 0.465
Total Biaya $0.798 $0.047
Harga input $0.220 / 1M $0.250 / 1M
Harga output $0.850 / 1M $1.500 / 1M
Total token input 118,486 119,076
Token output 156,166 11,118
Token penalaran 860,619 0
Waktu respons (rata-rata) 85.44s 1.85s
Waktu respons (maks) 525.14s 12.97s
Waktu respons (total) 1879.75s 40.74s
Parameter 398B total (13B aktif) ~150B total (~10B aktif)
Ketersediaan Bobot tersedia Tertutup

Showcase generasi model

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#169 Trinity Large Thinking

medium
Biaya
$0.016
Waktu
75.9s
Token
19,401 tok

#162 Gemini 3.1 Flash Lite

minimal
Biaya
$0.001
Waktu
3.7s
Token
635 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Trinity Large Thinking 7.5 10.0 66.7% 0 179.02s 7,248 7,413 351,155
Gemini 3.1 Flash Lite 5.5 10.0 33.3% 0 831ms 8,126 666 0

Perbandingan Cepat

Ganti Pasangan Perbandingan