AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#152

LongCat 2.0

Meituan रिलीज़: 2026-07-20 परीक्षण किया गया: 2026-08-14 04:16 meituan/longcat-2.0::low
1.6T कुल (48B सक्रिय)MoEमुक्त स्रोत

सारांश

LongCat 2.0 AI BENCHY पर 6.7 स्कोर करता है और #152 पर है। इसकी reliability 9.9, pass rate 54.6%, कुल लागत $0.412, और औसत response time 113.61s है।

LongCat 2.0 को अलग क्या बनाता है: यह संयुक्त में सबसे अलग दिखता है, जहाँ इसकी रैंक #1 है; जबकि पहेली समाधान इसकी सबसे कमजोर जगह है, जहाँ यह #15 पर है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

घोषित
पैरामीटर
1.6T कुल (48B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
लाइसेंस
MIT

संगति

8.5

कुल आउटपुट टोकन

320,594

कुल इनपुट टोकन

90,870

इनपुट कीमत

$0.300 / 1M

आउटपुट कीमत

$1.200 / 1M

सही परीक्षण

गलत टेस्ट: 12

प्रति प्रयास पास दर: 54.6%

अस्थिर टेस्ट

4

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

113.61s

प्रतिक्रिया समय (अधिकतम): 560.39s

प्रतिक्रिया समय (कुल): 2499.46s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#152 LongCat 2.0

low
लागत
$0.024
समय
428.0s
टोकन
19,557 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-08-14 04:16 दोबारा परीक्षण 6.7 9.9 $0.412 वर्तमान रन
2026-07-20 16:55 पहला रन 6.7 9.6 $0.391 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख इनपुट कीमत आउटपुट कीमत
2026-08-14 12:51 $0.300 / 1M $1.200 / 1M

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 10.0 10.0
कोडिंग 6.6 4.6
संयुक्त 10.0 10.0
डेटा पार्सिंग और निष्कर्षण 6.3 10.0
डोमेन-विशिष्ट 2.9 7.2
Samanya Buddhimatta 3.4 2.2
निर्देश पालन 6.5 10.0
पहेली समाधान 3.1 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल