नेव्हिगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Sonnet 4.6 vs Meituan: LongCat 2.0

LongCat 2.0 (medium) average score मध्ये पुढे आहे: 7.4 vs 7.3. LongCat 2.0 (medium) चा benchmark खर्च कमी आहे: $0.478 vs $0.661. Claude Sonnet 4.6 वेगवान आहे: 8.12s vs 136.64s, pass rates 57.6% vs 60.6%.

शिफारस केलेले मॉडेलClaude Sonnet 4.6Its score stays close to the best score here (7.3 vs 7.4), while responding about 16.8x faster than LongCat 2.0 (medium).

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-07-20

मेट्रिक Claude Sonnet 4.6 Claude Sonnet 4.6 none प्रकाशन: 2026-02-17 LongCat 2.0 LongCat 2.0 medium प्रकाशन: 2026-07-20
स्कोअर 7.3 7.4
क्रमांक #63 #60
विश्वसनीयता 10.0 9.8
सुसंगतता 9.7 8.9
बरोबर चाचण्या
प्रति प्रयत्न पास दर 57.6% 60.6%
अस्थिर चाचण्या 1 3
एकूण रन 66 66
प्रति निकाल खर्च 5.502 3.978
एकूण खर्च $0.661 $0.478
इनपुट किंमत $3.000 / 1M $0.300 / 1M
आउटपुट किंमत $15.000 / 1M $1.200 / 1M
एकूण इनपुट टोकन्स 123,264 97,315
आउटपुट टोकन्स 19,362 44,384
रिझनिंग टोकन्स 0 329,012
प्रतिसाद वेळ (सरासरी) 8.12s 136.64s
प्रतिसाद वेळ (कमाल) 51.18s 939.52s
प्रतिसाद वेळ (एकूण) 121.78s 3006.01s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#63 Claude Sonnet 4.6

none
खर्च
$0.038
वेळ
27.3s
टोकन्स
2,598 tok

#60 LongCat 2.0

medium
खर्च
$0.016
वेळ
285.1s
टोकन्स
13,057 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Claude Sonnet 4.6 5.5 10.0 33.3% 0 5.19s 8,522 2,127 0
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143

झटपट तुलना

तुलना जोडी बदला