नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Google: Gemini 3.1 Flash Lite vs Meituan: LongCat 2.0

Gemini 3.1 Flash Lite (low) average score में आगे है: 6.5 vs 6.3. LongCat 2.0 की benchmark लागत कम है: $0.044 vs $0.621. LongCat 2.0 तेज है: 5.18s vs 16.26s, pass rates 59.1% vs 36.4%.

अनुशंसित मॉडलLongCat 2.0Its score stays close to the best score here (6.3 vs 6.5), while costing about 14.1x less than Gemini 3.1 Flash Lite (low).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-20

मेट्रिक Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite low रिलीज़: 2026-05-08 LongCat 2.0 LongCat 2.0 none रिलीज़: 2026-07-20
स्कोर 6.5 6.3
रैंक #105 #111
विश्वसनीयता 10.0 10.0
संगति 9.2 9.3
सही परीक्षण
प्रति प्रयास पास दर 59.1% 36.4%
अस्थिर टेस्ट 2 2
कुल रन 66 66
प्रति परिणाम लागत 5.170 0.627
कुल लागत $0.621 $0.044
इनपुट कीमत $0.250 / 1M $0.300 / 1M
आउटपुट कीमत $1.500 / 1M $1.200 / 1M
कुल इनपुट टोकन 94,224 108,743
आउटपुट टोकन 7,759 9,372
रीजनिंग टोकन 390,126 0
प्रतिक्रिया समय (औसत) 16.26s 5.18s
प्रतिक्रिया समय (अधिकतम) 318.02s 48.38s
प्रतिक्रिया समय (कुल) 357.64s 113.95s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#105 Gemini 3.1 Flash Lite

low
लागत
$0.003
समय
4.0s
टोकन
1,479 tok

#111 LongCat 2.0

none
लागत
$0.027
समय
411.7s
टोकन
22,283 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Gemini 3.1 Flash Lite 5.5 10.0 33.3% 0 1.53s 8,132 471 1,072
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0

त्वरित तुलना

तुलना जोड़ी बदलें