नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Meituan: LongCat 2.0 vs Meituan: LongCat 2.0

LongCat 2.0 (low) average score में आगे है: 6.7 vs 6.6. LongCat 2.0 (low) की benchmark लागत कम है: $0.391 vs $0.469. LongCat 2.0 (low) तेज है: 100.31s vs 148.73s, pass rates 53.0% vs 53.0%.

अनुशंसित मॉडलLongCat 2.0 (low)It has the strongest score in this comparison (6.7) and the best overall balance of cost and response time across all 2 models.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-20

मेट्रिक LongCat 2.0 LongCat 2.0 high रिलीज़: 2026-07-20 LongCat 2.0 LongCat 2.0 low रिलीज़: 2026-07-20
स्कोर 6.6 6.7
रैंक #97 #91
विश्वसनीयता 9.4 9.6
संगति 8.2 8.9
सही परीक्षण
प्रति प्रयास पास दर 53.0% 53.0%
अस्थिर टेस्ट 5 3
कुल रन 66 66
प्रति परिणाम लागत 5.202 3.910
कुल लागत $0.469 $0.391
इनपुट कीमत $0.300 / 1M $0.300 / 1M
आउटपुट कीमत $1.200 / 1M $1.200 / 1M
कुल इनपुट टोकन 93,357 90,909
आउटपुट टोकन 30,466 5,679
रीजनिंग टोकन 336,325 297,369
प्रतिक्रिया समय (औसत) 148.73s 100.31s
प्रतिक्रिया समय (अधिकतम) 941.66s 560.39s
प्रतिक्रिया समय (कुल) 3272.00s 2206.82s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#97 LongCat 2.0

high
अमान्य SVG
लागत
$0.000
समय
600.0s
टोकन
0 tok

#91 LongCat 2.0

low
लागत
$0.024
समय
428.0s
टोकन
19,557 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 7.6 7.2 77.8% 1 505.33s 6,913 244 192,377
LongCat 2.0 6.6 4.6 77.8% 2 479.30s 6,544 461 206,627

त्वरित तुलना

तुलना जोड़ी बदलें