नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

LongCat 2.0 vs Qwen3.6 Max Preview

average score लगभग बराबर है: 6.4 vs 6.4. LongCat 2.0 की benchmark लागत कम है: $0.044 vs $0.228. LongCat 2.0 तेज है: 5.17s vs 7.82s, pass rates 40.9% vs 56.1%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-03

रैंक
#172
कुल आउटपुट टोकन
9,375
प्रतिक्रिया समय (औसत)
5.17s
कुल लागत
$0.044
रैंक
#169
कुल आउटपुट टोकन
19,257
प्रतिक्रिया समय (औसत)
7.82s
कुल लागत
$0.228
अनुशंसित मॉडल LongCat 2.0

It has the best score here (6.4), while costing about 5.2x less than Qwen3.6 Max Preview.

विस्तृत तुलना

मेट्रिक LongCat 2.0 LongCat 2.0 none रिलीज़: 2026-07-20 Qwen3.6 Max Preview Qwen3.6 Max Preview none रिलीज़: 2026-04-20
स्कोर 6.4 6.4
रैंक #172 #169
विश्वसनीयता 10.0 9.9
संगति 9.3 9.3
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 40.9% 56.1%
अस्थिर टेस्ट 2 2
कुल रन 66 66
प्रति परिणाम लागत 0.549 2.248
कुल लागत $0.044 $0.228
इनपुट कीमत $0.300 / 1M $1.028 / 1M
आउटपुट कीमत $1.200 / 1M $6.162 / 1M
कुल इनपुट टोकन 108,752 106,348
आउटपुट टोकन 9,375 19,257
रीजनिंग टोकन 0 0
प्रतिक्रिया समय (औसत) 5.17s 7.82s
प्रतिक्रिया समय (अधिकतम) 48.38s 102.62s
प्रतिक्रिया समय (कुल) 113.83s 172.04s
पैरामीटर 1.6T कुल (48B सक्रिय) ~1T कुल (~40B सक्रिय)
उपलब्धता मुक्त स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#172 LongCat 2.0

none
लागत
$0.027
समय
411.7s
टोकन
22,283 tok

#169 Qwen3.6 Max Preview

none
लागत
$0.025
समय
83.9s
टोकन
4,066 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0
Qwen3.6 Max Preview 3.8 7.3 22.2% 1 3.12s 7,913 456 0

त्वरित तुलना

तुलना जोड़ी बदलें