नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Google: Gemini 3.5 Flash-Lite vs Meituan: LongCat 2.0

Gemini 3.5 Flash-Lite (medium) average score में आगे है: 6.5 vs 6.3. LongCat 2.0 की benchmark लागत कम है: $0.044 vs $0.369. LongCat 2.0 तेज है: 5.18s vs 6.01s, pass rates 69.7% vs 36.4%.

अनुशंसित मॉडलLongCat 2.0Its score stays close to the best score here (6.3 vs 6.5), while costing about 8.4x less than Gemini 3.5 Flash-Lite (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-21

मेट्रिक Gemini 3.5 Flash-Lite Gemini 3.5 Flash-Lite medium रिलीज़: 2026-07-21 LongCat 2.0 LongCat 2.0 none रिलीज़: 2026-07-20
स्कोर 6.5 6.3
रैंक #104 #117
विश्वसनीयता 10.0 10.0
संगति 7.4 9.3
सही परीक्षण
प्रति प्रयास पास दर 69.7% 36.4%
अस्थिर टेस्ट 7 2
कुल रन 66 66
प्रति परिणाम लागत 3.074 0.627
कुल लागत $0.369 $0.044
इनपुट कीमत $0.300 / 1M $0.300 / 1M
आउटपुट कीमत $2.500 / 1M $1.200 / 1M
कुल इनपुट टोकन 118,818 108,743
आउटपुट टोकन 11,677 9,372
रीजनिंग टोकन 121,611 0
प्रतिक्रिया समय (औसत) 6.01s 5.18s
प्रतिक्रिया समय (अधिकतम) 49.03s 48.38s
प्रतिक्रिया समय (कुल) 132.30s 113.95s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#104 Gemini 3.5 Flash-Lite

medium
लागत
$0.015
समय
16.4s
टोकन
5,971 tok

#117 LongCat 2.0

none
लागत
$0.027
समय
411.7s
टोकन
22,283 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Gemini 3.5 Flash-Lite 5.5 7.4 44.4% 1 8.37s 8,136 452 25,999
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0

त्वरित तुलना

तुलना जोड़ी बदलें