Navigasi
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Meituan: LongCat 2.0 vs Poolside: Laguna XS 2.1

LongCat 2.0 (high) unggul dalam skor rata-rata dengan 6.6 vs 6.5. Laguna XS 2.1 (medium) memiliki biaya benchmark lebih rendah di $0.068 vs $0.469. Laguna XS 2.1 (medium) lebih cepat di 47.93s vs 148.73s, dengan tingkat keberhasilan 53.0% vs 42.4%.

Model yang direkomendasikanLaguna XS 2.1 (medium)Its score stays close to the best score here (6.5 vs 6.6), while costing about 7.0x less than LongCat 2.0 (high).

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-07-20

Metrik LongCat 2.0 LongCat 2.0 high Rilis: 2026-07-20 Laguna XS 2.1 Laguna XS 2.1 medium Rilis: 2026-07-02 Tersedia gratis
Skor 6.6 6.5
Peringkat #97 #102
Keandalan 9.4 10.0
Konsistensi 8.2 9.6
Tes benar
Tingkat lulus per percobaan 53.0% 42.4%
Tes tidak stabil 5 1
Total Run 66 66
Biaya per hasil 5.202 0.746
Total Biaya $0.469 $0.068
Harga input $0.300 / 1M $0.060 / 1M
Harga output $1.200 / 1M $0.120 / 1M
Total token input 93,357 118,989
Token output 30,466 30,750
Token penalaran 336,325 491,833
Waktu respons (rata-rata) 148.73s 47.93s
Waktu respons (maks) 941.66s 422.72s
Waktu respons (total) 3272.00s 1054.49s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#97 LongCat 2.0

high
SVG tidak valid
Biaya
$0.000
Waktu
600.0s
Token
0 tok

#102 Laguna XS 2.1

medium
Biaya
$0.001
Waktu
30.6s
Token
4,678 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
LongCat 2.0 7.6 7.2 77.8% 1 505.33s 6,913 244 192,377
Laguna XS 2.1 5.5 10.0 33.3% 0 70.35s 7,995 23,767 83,258

Perbandingan Cepat

Ganti Pasangan Perbandingan