नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Meituan: LongCat 2.0 vs Qwen: Qwen3.6 35B A3B

average score लगभग बराबर है: 6.7 vs 6.7. LongCat 2.0 (low) की benchmark लागत कम है: $0.391 vs $0.746. Qwen3.6 35B A3B (medium) तेज है: 58.06s vs 100.31s, pass rates 53.0% vs 60.6%.

अनुशंसित मॉडलLongCat 2.0 (low)It has the best score here (6.7), while costing about 1.9x less than Qwen3.6 35B A3B (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-21

मेट्रिक LongCat 2.0 LongCat 2.0 low रिलीज़: 2026-07-20 Qwen3.6 35B A3B Qwen3.6 35B A3B medium रिलीज़: 2026-04-20
स्कोर 6.7 6.7
रैंक #96 #94
विश्वसनीयता 9.6 10.0
संगति 8.9 9.6
सही परीक्षण
प्रति प्रयास पास दर 53.0% 60.6%
अस्थिर टेस्ट 3 1
कुल रन 66 66
प्रति परिणाम लागत 3.910 5.712
कुल लागत $0.391 $0.746
इनपुट कीमत $0.300 / 1M $0.140 / 1M
आउटपुट कीमत $1.200 / 1M $1.000 / 1M
कुल इनपुट टोकन 90,909 85,139
आउटपुट टोकन 5,679 61,819
रीजनिंग टोकन 297,369 678,766
प्रतिक्रिया समय (औसत) 100.31s 58.06s
प्रतिक्रिया समय (अधिकतम) 560.39s 817.57s
प्रतिक्रिया समय (कुल) 2206.82s 1161.18s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#96 LongCat 2.0

low
लागत
$0.024
समय
428.0s
टोकन
19,557 tok

#94 Qwen3.6 35B A3B

medium
अमान्य SVG
लागत
$0.000
समय
300.0s
टोकन
0 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 6.6 4.6 77.8% 2 479.30s 6,544 461 206,627
Qwen3.6 35B A3B 7.7 10.0 66.7% 0 50.55s 5,051 7,929 37,223

त्वरित तुलना

तुलना जोड़ी बदलें