नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Meituan: LongCat 2.0 vs Qwen: Qwen3.6 Max Preview

LongCat 2.0 (low) average score में आगे है: 6.7 vs 6.6. Qwen3.6 Max Preview की benchmark लागत कम है: $0.231 vs $0.391. Qwen3.6 Max Preview तेज है: 7.82s vs 100.31s, pass rates 53.0% vs 60.6%.

अनुशंसित मॉडलQwen3.6 Max PreviewIts score stays close to the best score here (6.6 vs 6.7), while costing about 1.7x less than LongCat 2.0 (low).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-21

मेट्रिक LongCat 2.0 LongCat 2.0 low रिलीज़: 2026-07-20 Qwen3.6 Max Preview Qwen3.6 Max Preview none रिलीज़: 2026-04-20
स्कोर 6.7 6.6
रैंक #96 #103
विश्वसनीयता 9.6 9.9
संगति 8.9 9.3
सही परीक्षण
प्रति प्रयास पास दर 53.0% 60.6%
अस्थिर टेस्ट 3 2
कुल रन 66 66
प्रति परिणाम लागत 3.910 2.061
कुल लागत $0.391 $0.231
इनपुट कीमत $0.300 / 1M $1.040 / 1M
आउटपुट कीमत $1.200 / 1M $6.240 / 1M
कुल इनपुट टोकन 90,909 106,339
आउटपुट टोकन 5,679 19,257
रीजनिंग टोकन 297,369 0
प्रतिक्रिया समय (औसत) 100.31s 7.82s
प्रतिक्रिया समय (अधिकतम) 560.39s 102.62s
प्रतिक्रिया समय (कुल) 2206.82s 172.01s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#96 LongCat 2.0

low
लागत
$0.024
समय
428.0s
टोकन
19,557 tok

#103 Qwen3.6 Max Preview

none
लागत
$0.025
समय
83.9s
टोकन
4,066 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 6.6 4.6 77.8% 2 479.30s 6,544 461 206,627
Qwen3.6 Max Preview 3.8 7.3 22.2% 1 3.12s 7,913 456 0

त्वरित तुलना

तुलना जोड़ी बदलें