Navigasi
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Google: Gemini 3.5 Flash-Lite vs Meituan: LongCat 2.0

Gemini 3.5 Flash-Lite (medium) unggul dalam skor rata-rata dengan 6.5 vs 6.3. LongCat 2.0 memiliki biaya benchmark lebih rendah di $0.044 vs $0.369. LongCat 2.0 lebih cepat di 5.18s vs 6.01s, dengan tingkat keberhasilan 69.7% vs 36.4%.

Model yang direkomendasikanLongCat 2.0Its score stays close to the best score here (6.3 vs 6.5), while costing about 8.4x less than Gemini 3.5 Flash-Lite (medium).

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-07-21

Metrik Gemini 3.5 Flash-Lite Gemini 3.5 Flash-Lite medium Rilis: 2026-07-21 LongCat 2.0 LongCat 2.0 none Rilis: 2026-07-20
Skor 6.5 6.3
Peringkat #104 #117
Keandalan 10.0 10.0
Konsistensi 7.4 9.3
Tes benar
Tingkat lulus per percobaan 69.7% 36.4%
Tes tidak stabil 7 2
Total Run 66 66
Biaya per hasil 3.074 0.627
Total Biaya $0.369 $0.044
Harga input $0.300 / 1M $0.300 / 1M
Harga output $2.500 / 1M $1.200 / 1M
Total token input 118,818 108,743
Token output 11,677 9,372
Token penalaran 121,611 0
Waktu respons (rata-rata) 6.01s 5.18s
Waktu respons (maks) 49.03s 48.38s
Waktu respons (total) 132.30s 113.95s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#104 Gemini 3.5 Flash-Lite

medium
Biaya
$0.015
Waktu
16.4s
Token
5,971 tok

#117 LongCat 2.0

none
Biaya
$0.027
Waktu
411.7s
Token
22,283 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Gemini 3.5 Flash-Lite 5.5 7.4 44.4% 1 8.37s 8,136 452 25,999
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0

Perbandingan Cepat

Ganti Pasangan Perbandingan