নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Google: Gemini 3.1 Flash Lite vs Meituan: LongCat 2.0

Gemini 3.1 Flash Lite (low) average score-এ এগিয়ে: 6.5 vs 6.3. LongCat 2.0-এর benchmark খরচ কম: $0.044 vs $0.621. LongCat 2.0 দ্রুত: 5.18s vs 16.26s, pass rates 59.1% vs 36.4%.

প্রস্তাবিত মডেলLongCat 2.0Its score stays close to the best score here (6.3 vs 6.5), while costing about 14.1x less than Gemini 3.1 Flash Lite (low).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-20

মেট্রিক Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite low প্রকাশ: 2026-05-08 LongCat 2.0 LongCat 2.0 none প্রকাশ: 2026-07-20
স্কোর 6.5 6.3
র‍্যাঙ্ক #105 #111
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 9.2 9.3
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 59.1% 36.4%
অস্থির টেস্ট 2 2
মোট রান 66 66
প্রতি ফলাফলে খরচ 5.170 0.627
মোট খরচ $0.621 $0.044
ইনপুট মূল্য $0.250 / 1M $0.300 / 1M
আউটপুট মূল্য $1.500 / 1M $1.200 / 1M
মোট ইনপুট টোকেন 94,224 108,743
আউটপুট টোকেন 7,759 9,372
রিজনিং টোকেন 390,126 0
প্রতিক্রিয়া সময় (গড়) 16.26s 5.18s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 318.02s 48.38s
প্রতিক্রিয়া সময় (মোট) 357.64s 113.95s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#105 Gemini 3.1 Flash Lite

low
খরচ
$0.003
সময়
4.0s
টোকেন
1,479 tok

#111 LongCat 2.0

none
খরচ
$0.027
সময়
411.7s
টোকেন
22,283 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Gemini 3.1 Flash Lite 5.5 10.0 33.3% 0 1.53s 8,132 471 1,072
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0

দ্রুত তুলনা

তুলনার জুটি বদলান