नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Meituan: LongCat 2.0 vs Qwen: Qwen3.5-35B-A3B

LongCat 2.0 average score में आगे है: 6.3 vs 6.2. LongCat 2.0 की benchmark लागत कम है: $0.044 vs $0.837. LongCat 2.0 तेज है: 5.18s vs 112.47s, pass rates 36.4% vs 66.7%.

अनुशंसित मॉडलLongCat 2.0It has the best score here (6.3), while costing about 19.1x less than Qwen3.5-35B-A3B (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-20

मेट्रिक LongCat 2.0 LongCat 2.0 none रिलीज़: 2026-07-20 Qwen3.5-35B-A3B Qwen3.5-35B-A3B medium रिलीज़: 2026-02-24
स्कोर 6.3 6.2
रैंक #111 #119
विश्वसनीयता 10.0 10.0
संगति 9.3 7.6
सही परीक्षण
प्रति प्रयास पास दर 36.4% 66.7%
अस्थिर टेस्ट 2 6
कुल रन 66 66
प्रति परिणाम लागत 0.627 9.130
कुल लागत $0.044 $0.837
इनपुट कीमत $0.300 / 1M $0.140 / 1M
आउटपुट कीमत $1.200 / 1M $1.000 / 1M
कुल इनपुट टोकन 108,743 130,388
आउटपुट टोकन 9,372 40,630
रीजनिंग टोकन 0 786,040
प्रतिक्रिया समय (औसत) 5.18s 112.47s
प्रतिक्रिया समय (अधिकतम) 48.38s 950.25s
प्रतिक्रिया समय (कुल) 113.95s 2474.28s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#111 LongCat 2.0

none
लागत
$0.027
समय
411.7s
टोकन
22,283 tok

#119 Qwen3.5-35B-A3B

medium
लागत
$0.009
समय
71.4s
टोकन
8,631 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0
Qwen3.5-35B-A3B 5.9 9.3 33.3% 0 206.65s 4,106 23,844 111,462

त्वरित तुलना

तुलना जोड़ी बदलें