Navigasi
AI BENCHY
Advertise here

Meituan: LongCat 2.0 vs Poolside: Laguna XS 2.1

Laguna XS 2.1 (medium) unggul dalam skor rata-rata dengan 6.5 vs 6.3. LongCat 2.0 memiliki biaya benchmark lebih rendah di $0.044 vs $0.068. LongCat 2.0 lebih cepat di 5.18s vs 47.93s, dengan tingkat keberhasilan 36.4% vs 42.4%.

Model yang direkomendasikanLongCat 2.0Its score stays close to the best score here (6.3 vs 6.5), while costing about 1.5x less than Laguna XS 2.1 (medium).

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-07-21

Metrik LongCat 2.0 LongCat 2.0 none Rilis: 2026-07-20 Laguna XS 2.1 Laguna XS 2.1 medium Rilis: 2026-07-02 Tersedia gratis
Skor 6.3 6.5
Peringkat #117 #108
Keandalan 10.0 10.0
Konsistensi 9.3 9.6
Tes benar
Tingkat lulus per percobaan 36.4% 42.4%
Tes tidak stabil 2 1
Total Run 66 66
Biaya per hasil 0.627 0.746
Total Biaya $0.044 $0.068
Harga input $0.300 / 1M $0.060 / 1M
Harga output $1.200 / 1M $0.120 / 1M
Total token input 108,743 118,989
Token output 9,372 30,750
Token penalaran 0 491,833
Waktu respons (rata-rata) 5.18s 47.93s
Waktu respons (maks) 48.38s 422.72s
Waktu respons (total) 113.95s 1054.49s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#117 LongCat 2.0

none
Biaya
$0.027
Waktu
411.7s
Token
22,283 tok

#108 Laguna XS 2.1

medium
Biaya
$0.001
Waktu
30.6s
Token
4,678 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0
Laguna XS 2.1 5.5 10.0 33.3% 0 70.35s 7,995 23,767 83,258

Perbandingan Cepat

Ganti Pasangan Perbandingan