AI BENCHY
Advertise here
#155

LongCat 2.0

Meituan रिलीज़: 2026-07-20 परीक्षण किया गया: 2026-08-14 04:15 meituan/longcat-2.0::high
1.6T कुल (48B सक्रिय)MoEमुक्त स्रोत

सारांश

LongCat 2.0 AI BENCHY पर 6.7 स्कोर करता है और #155 पर है। इसकी reliability 10.0, pass rate 51.5%, कुल लागत $0.492, और औसत response time 153.29s है।

LongCat 2.0 को अलग क्या बनाता है: यह कोडिंग में सबसे अलग दिखता है, जहाँ इसकी रैंक #1 है; जबकि डेटा पार्सिंग और निष्कर्षण इसकी सबसे कमजोर जगह है, जहाँ यह #15 पर है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

घोषित
पैरामीटर
1.6T कुल (48B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
लाइसेंस
MIT

संगति

8.4

कुल आउटपुट टोकन

386,642

कुल इनपुट टोकन

93,411

इनपुट कीमत

$0.300 / 1M

आउटपुट कीमत

$1.200 / 1M

सही परीक्षण

गलत टेस्ट: 13

प्रति प्रयास पास दर: 51.5%

अस्थिर टेस्ट

4

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

153.29s

प्रतिक्रिया समय (अधिकतम): 941.66s

प्रतिक्रिया समय (कुल): 3372.36s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#155 LongCat 2.0

high
अमान्य SVG
लागत
$0.000
समय
600.0s
टोकन
0 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-08-14 04:15 दोबारा परीक्षण 6.7 10.0 $0.492 वर्तमान रन
2026-07-20 17:01 पहला रन 6.6 9.4 $0.469 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख इनपुट कीमत आउटपुट कीमत
2026-08-14 12:51 $0.300 / 1M $1.200 / 1M

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 8.9 8.1
कोडिंग 7.8 9.3
संयुक्त 10.0 10.0
डेटा पार्सिंग और निष्कर्षण 3.6 5.8
डोमेन-विशिष्ट 3.6 7.2
Samanya Buddhimatta 5.1 10.0
निर्देश पालन 6.5 10.0
पहेली समाधान 3.1 7.4
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल