नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Meituan: LongCat 2.0 vs Poolside: Laguna XS 2.1

Laguna XS 2.1 (medium) average score में आगे है: 6.5 vs 6.3. LongCat 2.0 की benchmark लागत कम है: $0.044 vs $0.068. LongCat 2.0 तेज है: 5.18s vs 47.93s, pass rates 36.4% vs 42.4%.

अनुशंसित मॉडलLongCat 2.0Its score stays close to the best score here (6.3 vs 6.5), while costing about 1.5x less than Laguna XS 2.1 (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-21

मेट्रिक LongCat 2.0 LongCat 2.0 none रिलीज़: 2026-07-20 Laguna XS 2.1 Laguna XS 2.1 medium रिलीज़: 2026-07-02 निःशुल्क उपलब्ध
स्कोर 6.3 6.5
रैंक #117 #108
विश्वसनीयता 10.0 10.0
संगति 9.3 9.6
सही परीक्षण
प्रति प्रयास पास दर 36.4% 42.4%
अस्थिर टेस्ट 2 1
कुल रन 66 66
प्रति परिणाम लागत 0.627 0.746
कुल लागत $0.044 $0.068
इनपुट कीमत $0.300 / 1M $0.060 / 1M
आउटपुट कीमत $1.200 / 1M $0.120 / 1M
कुल इनपुट टोकन 108,743 118,989
आउटपुट टोकन 9,372 30,750
रीजनिंग टोकन 0 491,833
प्रतिक्रिया समय (औसत) 5.18s 47.93s
प्रतिक्रिया समय (अधिकतम) 48.38s 422.72s
प्रतिक्रिया समय (कुल) 113.95s 1054.49s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#117 LongCat 2.0

none
लागत
$0.027
समय
411.7s
टोकन
22,283 tok

#108 Laguna XS 2.1

medium
लागत
$0.001
समय
30.6s
टोकन
4,678 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0
Laguna XS 2.1 5.5 10.0 33.3% 0 70.35s 7,995 23,767 83,258

त्वरित तुलना

तुलना जोड़ी बदलें