नेव्हिगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Meituan: LongCat 2.0 vs Qwen: Qwen3.5-27B

average score जवळपास समान आहे: 7.4 vs 7.4. LongCat 2.0 (medium) चा benchmark खर्च कमी आहे: $0.478 vs $1.627. Qwen3.5-27B (medium) वेगवान आहे: 111.94s vs 136.64s, pass rates 60.6% vs 72.7%.

शिफारस केलेले मॉडेलLongCat 2.0 (medium)It has the best score here (7.4), while costing about 3.4x less than Qwen3.5-27B (medium).

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-07-20

मेट्रिक LongCat 2.0 LongCat 2.0 medium प्रकाशन: 2026-07-20 Qwen3.5-27B Qwen3.5-27B medium प्रकाशन: 2026-02-24
स्कोअर 7.4 7.4
क्रमांक #60 #58
विश्वसनीयता 9.8 10.0
सुसंगतता 8.9 8.2
बरोबर चाचण्या
प्रति प्रयत्न पास दर 60.6% 72.7%
अस्थिर चाचण्या 3 5
एकूण रन 66 66
प्रति निकाल खर्च 3.978 8.324
एकूण खर्च $0.478 $1.627
इनपुट किंमत $0.300 / 1M $0.260 / 1M
आउटपुट किंमत $1.200 / 1M $2.600 / 1M
एकूण इनपुट टोकन्स 97,315 111,635
आउटपुट टोकन्स 44,384 15,999
रिझनिंग टोकन्स 329,012 598,430
प्रतिसाद वेळ (सरासरी) 136.64s 111.94s
प्रतिसाद वेळ (कमाल) 939.52s 1026.43s
प्रतिसाद वेळ (एकूण) 3006.01s 2462.67s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#60 LongCat 2.0

medium
खर्च
$0.016
वेळ
285.1s
टोकन्स
13,057 tok

#58 Qwen3.5-27B

medium
खर्च
$0.008
वेळ
62.0s
टोकन्स
3,099 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143
Qwen3.5-27B 6.2 7.1 55.6% 1 160.69s 7,895 6,381 89,388

झटपट तुलना

तुलना जोडी बदला