नेविगेशन
AI BENCHY
Advertise here

Meituan: LongCat 2.0 vs Qwen: Qwen3.6 27B

LongCat 2.0 (high) average score में आगे है: 6.6 vs 6.5. LongCat 2.0 (high) की benchmark लागत कम है: $0.469 vs $0.779. Qwen3.6 27B (medium) तेज है: 106.32s vs 148.73s, pass rates 53.0% vs 59.1%.

अनुशंसित मॉडलLongCat 2.0 (high)It has the best score here (6.6), while costing about 1.7x less than Qwen3.6 27B (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-21

मेट्रिक LongCat 2.0 LongCat 2.0 high रिलीज़: 2026-07-20 Qwen3.6 27B Qwen3.6 27B medium रिलीज़: 2026-04-20
स्कोर 6.6 6.5
रैंक #102 #105
विश्वसनीयता 9.4 10.0
संगति 8.2 8.0
सही परीक्षण
प्रति प्रयास पास दर 53.0% 59.1%
अस्थिर टेस्ट 5 6
कुल रन 66 66
प्रति परिणाम लागत 5.202 7.319
कुल लागत $0.469 $0.779
इनपुट कीमत $0.300 / 1M $0.450 / 1M
आउटपुट कीमत $1.200 / 1M $2.700 / 1M
कुल इनपुट टोकन 93,357 106,167
आउटपुट टोकन 30,466 32,889
रीजनिंग टोकन 336,325 241,303
प्रतिक्रिया समय (औसत) 148.73s 106.32s
प्रतिक्रिया समय (अधिकतम) 941.66s 1085.11s
प्रतिक्रिया समय (कुल) 3272.00s 2339.12s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#102 LongCat 2.0

high
अमान्य SVG
लागत
$0.000
समय
600.0s
टोकन
0 tok

#105 Qwen3.6 27B

medium
लागत
$0.009
समय
39.6s
टोकन
3,090 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 7.6 7.2 77.8% 1 505.33s 6,913 244 192,377
Qwen3.6 27B 7.7 10.0 66.7% 0 142.99s 5,051 7,968 43,367

त्वरित तुलना

तुलना जोड़ी बदलें