नेविगेशन
AI BENCHY
Advertise here

Gemma 4 31B (medium) vs LongCat 2.0

LongCat 2.0 average score में आगे है: 6.4 vs 6.2. LongCat 2.0 की benchmark लागत कम है: $0.044 vs $0.100. LongCat 2.0 तेज है: 5.17s vs 78.59s, pass rates 65.2% vs 40.9%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-03

रैंक
#179
कुल आउटपुट टोकन
267,421
प्रतिक्रिया समय (औसत)
78.59s
कुल लागत
$0.100
रैंक
#172
कुल आउटपुट टोकन
9,375
प्रतिक्रिया समय (औसत)
5.17s
कुल लागत
$0.044
अनुशंसित मॉडल LongCat 2.0

It has the best score here (6.4), while costing about 2.3x less than Gemma 4 31B (medium).

विस्तृत तुलना

मेट्रिक Gemma 4 31B Gemma 4 31B medium रिलीज़: 2026-04-02 निःशुल्क उपलब्ध LongCat 2.0 LongCat 2.0 none रिलीज़: 2026-07-20
स्कोर 6.2 6.4
रैंक #179 #172
विश्वसनीयता 10.0 10.0
संगति 8.7 9.3
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 65.2% 40.9%
अस्थिर टेस्ट 3 2
कुल रन 66 66
प्रति परिणाम लागत 1.152 0.549
कुल लागत $0.100 $0.044
इनपुट कीमत $0.090 / 1M $0.300 / 1M
आउटपुट कीमत $0.340 / 1M $1.200 / 1M
कुल इनपुट टोकन 94,969 108,752
आउटपुट टोकन 34,399 9,375
रीजनिंग टोकन 233,022 0
प्रतिक्रिया समय (औसत) 78.59s 5.17s
प्रतिक्रिया समय (अधिकतम) 437.40s 48.38s
प्रतिक्रिया समय (कुल) 1571.84s 113.83s
पैरामीटर 30.7B 1.6T कुल (48B सक्रिय)
उपलब्धता मुक्त स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#179 Gemma 4 31B

medium
लागत
$0.002
समय
45.7s
टोकन
2,696 tok

#172 LongCat 2.0

none
लागत
$0.027
समय
411.7s
टोकन
22,283 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Gemma 4 31B 4.3 5.8 22.2% 1 219.76s 5,568 11,098 33,212
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0

त्वरित तुलना

तुलना जोड़ी बदलें