नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Opus 4.8 vs Meituan: LongCat 2.0

LongCat 2.0 (medium) average score में आगे है: 7.4 vs 7.3. LongCat 2.0 (medium) की benchmark लागत कम है: $0.478 vs $1.166. Claude Opus 4.8 तेज है: 4.91s vs 136.64s, pass rates 63.6% vs 60.6%.

अनुशंसित मॉडलClaude Opus 4.8Its score stays close to the best score here (7.3 vs 7.4), while responding about 27.8x faster than LongCat 2.0 (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-21

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 none रिलीज़: 2026-05-28 LongCat 2.0 LongCat 2.0 medium रिलीज़: 2026-07-20
स्कोर 7.3 7.4
रैंक #70 #64
विश्वसनीयता 10.0 9.8
संगति 9.2 8.9
सही परीक्षण
प्रति प्रयास पास दर 63.6% 60.6%
अस्थिर टेस्ट 2 3
कुल रन 66 66
प्रति परिणाम लागत 8.969 3.978
कुल लागत $1.166 $0.478
इनपुट कीमत $5.000 / 1M $0.300 / 1M
आउटपुट कीमत $25.000 / 1M $1.200 / 1M
कुल इनपुट टोकन 149,206 97,315
आउटपुट टोकन 16,797 44,384
रीजनिंग टोकन 0 329,012
प्रतिक्रिया समय (औसत) 4.91s 136.64s
प्रतिक्रिया समय (अधिकतम) 35.03s 939.52s
प्रतिक्रिया समय (कुल) 108.03s 3006.01s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#70 Claude Opus 4.8

none
लागत
$0.053
समय
22.0s
टोकन
2,253 tok

#64 LongCat 2.0

medium
लागत
$0.016
समय
285.1s
टोकन
13,057 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 5.5 10.0 33.3% 0 3.29s 10,590 1,332 0
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143

त्वरित तुलना

तुलना जोड़ी बदलें