नेविगेशन
AI BENCHY
Advertise here

Anthropic: Claude Sonnet 4.6 vs Meituan: LongCat 2.0

LongCat 2.0 (medium) average score में आगे है: 7.4 vs 7.3. LongCat 2.0 (medium) की benchmark लागत कम है: $0.478 vs $0.661. Claude Sonnet 4.6 तेज है: 8.12s vs 136.64s, pass rates 57.6% vs 60.6%.

अनुशंसित मॉडलClaude Sonnet 4.6Its score stays close to the best score here (7.3 vs 7.4), while responding about 16.8x faster than LongCat 2.0 (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-20

मेट्रिक Claude Sonnet 4.6 Claude Sonnet 4.6 none रिलीज़: 2026-02-17 LongCat 2.0 LongCat 2.0 medium रिलीज़: 2026-07-20
स्कोर 7.3 7.4
रैंक #63 #60
विश्वसनीयता 10.0 9.8
संगति 9.7 8.9
सही परीक्षण
प्रति प्रयास पास दर 57.6% 60.6%
अस्थिर टेस्ट 1 3
कुल रन 66 66
प्रति परिणाम लागत 5.502 3.978
कुल लागत $0.661 $0.478
इनपुट कीमत $3.000 / 1M $0.300 / 1M
आउटपुट कीमत $15.000 / 1M $1.200 / 1M
कुल इनपुट टोकन 123,264 97,315
आउटपुट टोकन 19,362 44,384
रीजनिंग टोकन 0 329,012
प्रतिक्रिया समय (औसत) 8.12s 136.64s
प्रतिक्रिया समय (अधिकतम) 51.18s 939.52s
प्रतिक्रिया समय (कुल) 121.78s 3006.01s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#63 Claude Sonnet 4.6

none
लागत
$0.038
समय
27.3s
टोकन
2,598 tok

#60 LongCat 2.0

medium
लागत
$0.016
समय
285.1s
टोकन
13,057 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 4.6 5.5 10.0 33.3% 0 5.19s 8,522 2,127 0
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143

त्वरित तुलना

तुलना जोड़ी बदलें