नेविगेशन
AI BENCHY
Advertise here

Meituan: LongCat 2.0 vs Qwen: Qwen3.6 27B

LongCat 2.0 (low) average score में आगे है: 6.7 vs 6.5. LongCat 2.0 (low) की benchmark लागत कम है: $0.391 vs $0.779. LongCat 2.0 (low) तेज है: 100.31s vs 106.32s, pass rates 53.0% vs 59.1%.

अनुशंसित मॉडलLongCat 2.0 (low)It has the best score here (6.7), while costing about 2.0x less than Qwen3.6 27B (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-21

मेट्रिक LongCat 2.0 LongCat 2.0 low रिलीज़: 2026-07-20 Qwen3.6 27B Qwen3.6 27B medium रिलीज़: 2026-04-20
स्कोर 6.7 6.5
रैंक #96 #105
विश्वसनीयता 9.6 10.0
संगति 8.9 8.0
सही परीक्षण
प्रति प्रयास पास दर 53.0% 59.1%
अस्थिर टेस्ट 3 6
कुल रन 66 66
प्रति परिणाम लागत 3.910 7.319
कुल लागत $0.391 $0.779
इनपुट कीमत $0.300 / 1M $0.450 / 1M
आउटपुट कीमत $1.200 / 1M $2.700 / 1M
कुल इनपुट टोकन 90,909 106,167
आउटपुट टोकन 5,679 32,889
रीजनिंग टोकन 297,369 241,303
प्रतिक्रिया समय (औसत) 100.31s 106.32s
प्रतिक्रिया समय (अधिकतम) 560.39s 1085.11s
प्रतिक्रिया समय (कुल) 2206.82s 2339.12s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#96 LongCat 2.0

low
लागत
$0.024
समय
428.0s
टोकन
19,557 tok

#105 Qwen3.6 27B

medium
लागत
$0.009
समय
39.6s
टोकन
3,090 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 6.6 4.6 77.8% 2 479.30s 6,544 461 206,627
Qwen3.6 27B 7.7 10.0 66.7% 0 142.99s 5,051 7,968 43,367

त्वरित तुलना

तुलना जोड़ी बदलें