नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Meituan: LongCat 2.0 vs Qwen: Qwen3.5 Plus 2026-02-15

Qwen3.5 Plus 2026-02-15 average score में आगे है: 6.4 vs 6.3. LongCat 2.0 की benchmark लागत कम है: $0.044 vs $0.073. LongCat 2.0 तेज है: 5.18s vs 9.85s, pass rates 36.4% vs 48.5%.

अनुशंसित मॉडलLongCat 2.0Its score stays close to the best score here (6.3 vs 6.4), while costing about 1.7x less than Qwen3.5 Plus 2026-02-15.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-20

मेट्रिक LongCat 2.0 LongCat 2.0 none रिलीज़: 2026-07-20 Qwen3.5 Plus 2026-02-15 Qwen3.5 Plus 2026-02-15 none रिलीज़: 2026-02-15
स्कोर 6.3 6.4
रैंक #111 #107
विश्वसनीयता 10.0 10.0
संगति 9.3 9.4
सही परीक्षण
प्रति प्रयास पास दर 36.4% 48.5%
अस्थिर टेस्ट 2 2
कुल रन 66 66
प्रति परिणाम लागत 0.627 0.751
कुल लागत $0.044 $0.073
इनपुट कीमत $0.300 / 1M $0.260 / 1M
आउटपुट कीमत $1.200 / 1M $1.560 / 1M
कुल इनपुट टोकन 108,743 102,646
आउटपुट टोकन 9,372 29,370
रीजनिंग टोकन 0 0
प्रतिक्रिया समय (औसत) 5.18s 9.85s
प्रतिक्रिया समय (अधिकतम) 48.38s 123.00s
प्रतिक्रिया समय (कुल) 113.95s 157.63s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#111 LongCat 2.0

none
लागत
$0.027
समय
411.7s
टोकन
22,283 tok

#107 Qwen3.5 Plus 2026-02-15

none
लागत
$0.012
समय
153.2s
टोकन
7,787 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0
Qwen3.5 Plus 2026-02-15 4.3 7.9 11.1% 1 2.05s 7,913 473 0

त्वरित तुलना

तुलना जोड़ी बदलें