Navigasi
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Opus 4.8 vs Meituan: LongCat 2.0

LongCat 2.0 (medium) unggul dalam skor rata-rata dengan 7.4 vs 7.3. LongCat 2.0 (medium) memiliki biaya benchmark lebih rendah di $0.478 vs $1.166. Claude Opus 4.8 lebih cepat di 4.91s vs 136.64s, dengan tingkat keberhasilan 63.6% vs 60.6%.

Model yang direkomendasikanClaude Opus 4.8Its score stays close to the best score here (7.3 vs 7.4), while responding about 27.8x faster than LongCat 2.0 (medium).

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-07-21

Metrik Claude Opus 4.8 Claude Opus 4.8 none Rilis: 2026-05-28 LongCat 2.0 LongCat 2.0 medium Rilis: 2026-07-20
Skor 7.3 7.4
Peringkat #70 #64
Keandalan 10.0 9.8
Konsistensi 9.2 8.9
Tes benar
Tingkat lulus per percobaan 63.6% 60.6%
Tes tidak stabil 2 3
Total Run 66 66
Biaya per hasil 8.969 3.978
Total Biaya $1.166 $0.478
Harga input $5.000 / 1M $0.300 / 1M
Harga output $25.000 / 1M $1.200 / 1M
Total token input 149,206 97,315
Token output 16,797 44,384
Token penalaran 0 329,012
Waktu respons (rata-rata) 4.91s 136.64s
Waktu respons (maks) 35.03s 939.52s
Waktu respons (total) 108.03s 3006.01s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#70 Claude Opus 4.8

none
Biaya
$0.053
Waktu
22.0s
Token
2,253 tok

#64 LongCat 2.0

medium
Biaya
$0.016
Waktu
285.1s
Token
13,057 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Claude Opus 4.8 5.5 10.0 33.3% 0 3.29s 10,590 1,332 0
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143

Perbandingan Cepat

Ganti Pasangan Perbandingan