नेव्हिगेशन
AI BENCHY
Advertise here

Anthropic: Claude Opus 4.8 vs Meituan: LongCat 2.0

LongCat 2.0 (medium) average score मध्ये पुढे आहे: 7.4 vs 7.3. LongCat 2.0 (medium) चा benchmark खर्च कमी आहे: $0.478 vs $1.166. Claude Opus 4.8 वेगवान आहे: 4.91s vs 136.64s, pass rates 63.6% vs 60.6%.

शिफारस केलेले मॉडेलClaude Opus 4.8Its score stays close to the best score here (7.3 vs 7.4), while responding about 27.8x faster than LongCat 2.0 (medium).

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-07-21

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 none प्रकाशन: 2026-05-28 LongCat 2.0 LongCat 2.0 medium प्रकाशन: 2026-07-20
स्कोअर 7.3 7.4
क्रमांक #70 #64
विश्वसनीयता 10.0 9.8
सुसंगतता 9.2 8.9
बरोबर चाचण्या
प्रति प्रयत्न पास दर 63.6% 60.6%
अस्थिर चाचण्या 2 3
एकूण रन 66 66
प्रति निकाल खर्च 8.969 3.978
एकूण खर्च $1.166 $0.478
इनपुट किंमत $5.000 / 1M $0.300 / 1M
आउटपुट किंमत $25.000 / 1M $1.200 / 1M
एकूण इनपुट टोकन्स 149,206 97,315
आउटपुट टोकन्स 16,797 44,384
रिझनिंग टोकन्स 0 329,012
प्रतिसाद वेळ (सरासरी) 4.91s 136.64s
प्रतिसाद वेळ (कमाल) 35.03s 939.52s
प्रतिसाद वेळ (एकूण) 108.03s 3006.01s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#70 Claude Opus 4.8

none
खर्च
$0.053
वेळ
22.0s
टोकन्स
2,253 tok

#64 LongCat 2.0

medium
खर्च
$0.016
वेळ
285.1s
टोकन्स
13,057 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Claude Opus 4.8 5.5 10.0 33.3% 0 3.29s 10,590 1,332 0
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143

झटपट तुलना

तुलना जोडी बदला