नेविगेशन
AI BENCHY
Advertise here

LongCat 2.0 (medium) vs Qwen3.7 Max

average score लगभग बराबर है: 7.4 vs 7.4. Qwen3.7 Max की benchmark लागत कम है: $0.197 vs $0.499. Qwen3.7 Max तेज है: 4.56s vs 143.55s, pass rates 59.1% vs 68.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-03

रैंक
#104
कुल आउटपुट टोकन
390,873
प्रतिक्रिया समय (औसत)
143.55s
कुल लागत
$0.499
रैंक
#101
कुल आउटपुट टोकन
12,446
प्रतिक्रिया समय (औसत)
4.56s
कुल लागत
$0.197
अनुशंसित मॉडल Qwen3.7 Max

It has the best score here (7.4), while costing about 2.5x less than LongCat 2.0 (medium).

विस्तृत तुलना

मेट्रिक LongCat 2.0 LongCat 2.0 medium रिलीज़: 2026-07-20 Qwen3.7 Max Qwen3.7 Max none रिलीज़: 2026-05-22
स्कोर 7.4 7.4
रैंक #104 #101
विश्वसनीयता 10.0 9.9
संगति 9.3 10.0
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 59.1% 68.2%
अस्थिर टेस्ट 2 0
कुल रन 66 66
प्रति परिणाम लागत 4.153 1.581
कुल लागत $0.499 $0.197
इनपुट कीमत $0.300 / 1M $1.475 / 1M
आउटपुट कीमत $1.200 / 1M $4.425 / 1M
कुल इनपुट टोकन 97,324 95,992
आउटपुट टोकन 44,383 12,446
रीजनिंग टोकन 346,490 0
प्रतिक्रिया समय (औसत) 143.55s 4.56s
प्रतिक्रिया समय (अधिकतम) 939.52s 72.30s
प्रतिक्रिया समय (कुल) 3158.11s 100.30s
पैरामीटर 1.6T कुल (48B सक्रिय) ~1T कुल (~40B सक्रिय)
उपलब्धता मुक्त स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#104 LongCat 2.0

medium
लागत
$0.016
समय
285.1s
टोकन
13,057 tok

#101 Qwen3.7 Max

none
लागत
$0.046
समय
195.0s
टोकन
12,171 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143
Qwen3.7 Max 5.5 10.0 33.3% 0 1.35s 7,911 582 0

त्वरित तुलना

तुलना जोड़ी बदलें