नेविगेशन
AI BENCHY
Advertise here

LongCat 2.0 vs Laguna XS 2.1 (medium)

Laguna XS 2.1 (medium) average score में आगे है: 6.5 vs 6.4. LongCat 2.0 की benchmark लागत कम है: $0.044 vs $0.068. LongCat 2.0 तेज है: 5.17s vs 48.18s, pass rates 40.9% vs 45.5%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-03

रैंक
#172
कुल आउटपुट टोकन
9,375
प्रतिक्रिया समय (औसत)
5.17s
कुल लागत
$0.044
रैंक
#166
कुल आउटपुट टोकन
522,480
प्रतिक्रिया समय (औसत)
48.18s
कुल लागत
$0.068
अनुशंसित मॉडल LongCat 2.0

Its score stays close to the best score here (6.4 vs 6.5), while costing about 1.5x less than Laguna XS 2.1 (medium).

विस्तृत तुलना

मेट्रिक LongCat 2.0 LongCat 2.0 none रिलीज़: 2026-07-20 Laguna XS 2.1 Laguna XS 2.1 medium रिलीज़: 2026-07-02 निःशुल्क उपलब्ध
स्कोर 6.4 6.5
रैंक #172 #166
विश्वसनीयता 10.0 10.0
संगति 9.3 9.2
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 40.9% 45.5%
अस्थिर टेस्ट 2 2
कुल रन 66 66
प्रति परिणाम लागत 0.549 0.745
कुल लागत $0.044 $0.068
इनपुट कीमत $0.300 / 1M $0.060 / 1M
आउटपुट कीमत $1.200 / 1M $0.120 / 1M
कुल इनपुट टोकन 108,752 118,998
आउटपुट टोकन 9,375 30,750
रीजनिंग टोकन 0 491,730
प्रतिक्रिया समय (औसत) 5.17s 48.18s
प्रतिक्रिया समय (अधिकतम) 48.38s 422.72s
प्रतिक्रिया समय (कुल) 113.83s 1059.93s
पैरामीटर 1.6T कुल (48B सक्रिय) 33B कुल (3B सक्रिय)
उपलब्धता मुक्त स्रोत वेट उपलब्ध

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#172 LongCat 2.0

none
लागत
$0.027
समय
411.7s
टोकन
22,283 tok

#166 Laguna XS 2.1

medium
लागत
$0.001
समय
30.6s
टोकन
4,678 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0
Laguna XS 2.1 5.5 10.0 33.3% 0 70.35s 7,995 23,767 83,258

त्वरित तुलना

तुलना जोड़ी बदलें