नेविगेशन
Advertise here

Gemini 3.1 Flash Lite (low) vs LongCat 2.0

average score लगभग बराबर है: 6.3 vs 6.4. LongCat 2.0 की benchmark लागत कम है: $0.104 vs $0.717. LongCat 2.0 तेज है: 8.50s vs 19.02s, pass rates 60.9% vs 42.0%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#218
कुल आउटपुट टोकन
425,576
प्रतिक्रिया समय (औसत)
19.02s
कुल लागत
$0.717
रैंक
#212
कुल आउटपुट टोकन
17,473
प्रतिक्रिया समय (औसत)
8.50s
कुल लागत
$0.104
अनुशंसित मॉडल LongCat 2.0

It has the best score here (6.4), while costing about 6.9x less than Gemini 3.1 Flash Lite (low).

विस्तृत तुलना

मेट्रिक Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite low रिलीज़: 2026-05-08 LongCat 2.0 LongCat 2.0 none रिलीज़: 2026-07-20
स्कोर 6.3 6.4
रैंक #218 #212
विश्वसनीयता 10.0 10.0
संगति 9.3 9.0
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 60.9% 42.0%
अस्थिर टेस्ट 2 3
कुल रन 69 69
प्रति परिणाम लागत 5.512 1.298
कुल लागत $0.717 $0.104
इनपुट कीमत $0.250 / 1M $0.300 / 1M
आउटपुट कीमत $1.500 / 1M $1.200 / 1M
कुल इनपुट टोकन 312,368 276,199
आउटपुट टोकन 9,429 17,473
रीजनिंग टोकन 416,147 0
प्रतिक्रिया समय (औसत) 19.02s 8.50s
प्रतिक्रिया समय (अधिकतम) 318.02s 81.77s
प्रतिक्रिया समय (कुल) 437.38s 195.60s
पैरामीटर ~150B कुल (~10B सक्रिय) 1.6T कुल (48B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#218 Gemini 3.1 Flash Lite

low
लागत
$0.003
समय
4.0s
टोकन
1,479 tok

#212 LongCat 2.0

none
लागत
$0.027
समय
411.7s
टोकन
22,283 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Gemini 3.1 Flash Lite 5.5 10.0 33.3% 0 1.53s 8,132 471 1,072
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0

त्वरित तुलना

तुलना जोड़ी बदलें