नेविगेशन
AI BENCHY
Advertise here

Meituan: LongCat 2.0 vs Qwen: Qwen3.5-27B

average score लगभग बराबर है: 7.4 vs 7.4. LongCat 2.0 (medium) की benchmark लागत कम है: $0.478 vs $1.627. Qwen3.5-27B (medium) तेज है: 111.94s vs 136.64s, pass rates 60.6% vs 72.7%.

अनुशंसित मॉडलLongCat 2.0 (medium)It has the best score here (7.4), while costing about 3.4x less than Qwen3.5-27B (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-20

मेट्रिक LongCat 2.0 LongCat 2.0 medium रिलीज़: 2026-07-20 Qwen3.5-27B Qwen3.5-27B medium रिलीज़: 2026-02-24
स्कोर 7.4 7.4
रैंक #60 #58
विश्वसनीयता 9.8 10.0
संगति 8.9 8.2
सही परीक्षण
प्रति प्रयास पास दर 60.6% 72.7%
अस्थिर टेस्ट 3 5
कुल रन 66 66
प्रति परिणाम लागत 3.978 8.324
कुल लागत $0.478 $1.627
इनपुट कीमत $0.300 / 1M $0.260 / 1M
आउटपुट कीमत $1.200 / 1M $2.600 / 1M
कुल इनपुट टोकन 97,315 111,635
आउटपुट टोकन 44,384 15,999
रीजनिंग टोकन 329,012 598,430
प्रतिक्रिया समय (औसत) 136.64s 111.94s
प्रतिक्रिया समय (अधिकतम) 939.52s 1026.43s
प्रतिक्रिया समय (कुल) 3006.01s 2462.67s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#60 LongCat 2.0

medium
लागत
$0.016
समय
285.1s
टोकन
13,057 tok

#58 Qwen3.5-27B

medium
लागत
$0.008
समय
62.0s
टोकन
3,099 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143
Qwen3.5-27B 6.2 7.1 55.6% 1 160.69s 7,895 6,381 89,388

त्वरित तुलना

तुलना जोड़ी बदलें