নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Google: Gemini 3.5 Flash-Lite vs Meituan: LongCat 2.0

Gemini 3.5 Flash-Lite (medium) average score-এ এগিয়ে: 6.5 vs 6.3. LongCat 2.0-এর benchmark খরচ কম: $0.044 vs $0.369. LongCat 2.0 দ্রুত: 5.18s vs 6.01s, pass rates 69.7% vs 36.4%.

প্রস্তাবিত মডেলLongCat 2.0Its score stays close to the best score here (6.3 vs 6.5), while costing about 8.4x less than Gemini 3.5 Flash-Lite (medium).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-21

মেট্রিক Gemini 3.5 Flash-Lite Gemini 3.5 Flash-Lite medium প্রকাশ: 2026-07-21 LongCat 2.0 LongCat 2.0 none প্রকাশ: 2026-07-20
স্কোর 6.5 6.3
র‍্যাঙ্ক #104 #117
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 7.4 9.3
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 69.7% 36.4%
অস্থির টেস্ট 7 2
মোট রান 66 66
প্রতি ফলাফলে খরচ 3.074 0.627
মোট খরচ $0.369 $0.044
ইনপুট মূল্য $0.300 / 1M $0.300 / 1M
আউটপুট মূল্য $2.500 / 1M $1.200 / 1M
মোট ইনপুট টোকেন 118,818 108,743
আউটপুট টোকেন 11,677 9,372
রিজনিং টোকেন 121,611 0
প্রতিক্রিয়া সময় (গড়) 6.01s 5.18s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 49.03s 48.38s
প্রতিক্রিয়া সময় (মোট) 132.30s 113.95s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#104 Gemini 3.5 Flash-Lite

medium
খরচ
$0.015
সময়
16.4s
টোকেন
5,971 tok

#117 LongCat 2.0

none
খরচ
$0.027
সময়
411.7s
টোকেন
22,283 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Gemini 3.5 Flash-Lite 5.5 7.4 44.4% 1 8.37s 8,136 452 25,999
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0

দ্রুত তুলনা

তুলনার জুটি বদলান