Navigasi
AI BENCHY
Advertise here

Anthropic: Claude Sonnet 4.6 vs Meituan: LongCat 2.0

LongCat 2.0 (medium) unggul dalam skor rata-rata dengan 7.4 vs 7.3. LongCat 2.0 (medium) memiliki biaya benchmark lebih rendah di $0.478 vs $0.661. Claude Sonnet 4.6 lebih cepat di 8.12s vs 136.64s, dengan tingkat keberhasilan 57.6% vs 60.6%.

Model yang direkomendasikanClaude Sonnet 4.6Its score stays close to the best score here (7.3 vs 7.4), while responding about 16.8x faster than LongCat 2.0 (medium).

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-07-20

Metrik Claude Sonnet 4.6 Claude Sonnet 4.6 none Rilis: 2026-02-17 LongCat 2.0 LongCat 2.0 medium Rilis: 2026-07-20
Skor 7.3 7.4
Peringkat #63 #60
Keandalan 10.0 9.8
Konsistensi 9.7 8.9
Tes benar
Tingkat lulus per percobaan 57.6% 60.6%
Tes tidak stabil 1 3
Total Run 66 66
Biaya per hasil 5.502 3.978
Total Biaya $0.661 $0.478
Harga input $3.000 / 1M $0.300 / 1M
Harga output $15.000 / 1M $1.200 / 1M
Total token input 123,264 97,315
Token output 19,362 44,384
Token penalaran 0 329,012
Waktu respons (rata-rata) 8.12s 136.64s
Waktu respons (maks) 51.18s 939.52s
Waktu respons (total) 121.78s 3006.01s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#63 Claude Sonnet 4.6

none
Biaya
$0.038
Waktu
27.3s
Token
2,598 tok

#60 LongCat 2.0

medium
Biaya
$0.016
Waktu
285.1s
Token
13,057 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
Claude Sonnet 4.6 5.5 10.0 33.3% 0 5.19s 8,522 2,127 0
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143

Perbandingan Cepat

Ganti Pasangan Perbandingan