নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Google: Gemini 3.1 Flash Lite vs Meituan: LongCat 2.0

LongCat 2.0 average score-এ এগিয়ে: 6.3 vs 6.1. LongCat 2.0-এর benchmark খরচ কম: $0.044 vs $0.047. Gemini 3.1 Flash Lite (minimal) দ্রুত: 1.86s vs 5.18s, pass rates 51.5% vs 36.4%.

প্রস্তাবিত মডেলGemini 3.1 Flash Lite (minimal)Its score stays close to the best score here (6.1 vs 6.3), while responding about 2.8x faster than LongCat 2.0.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-20

মেট্রিক Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite minimal প্রকাশ: 2026-05-08 LongCat 2.0 LongCat 2.0 none প্রকাশ: 2026-07-20
স্কোর 6.1 6.3
র‍্যাঙ্ক #120 #111
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 8.9 9.3
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 51.5% 36.4%
অস্থির টেস্ট 3 2
মোট রান 66 66
প্রতি ফলাফলে খরচ 0.465 0.627
মোট খরচ $0.047 $0.044
ইনপুট মূল্য $0.250 / 1M $0.300 / 1M
আউটপুট মূল্য $1.500 / 1M $1.200 / 1M
মোট ইনপুট টোকেন 119,065 108,743
আউটপুট টোকেন 11,118 9,372
রিজনিং টোকেন 0 0
প্রতিক্রিয়া সময় (গড়) 1.86s 5.18s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 12.97s 48.38s
প্রতিক্রিয়া সময় (মোট) 40.88s 113.95s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#120 Gemini 3.1 Flash Lite

minimal
খরচ
$0.001
সময়
3.7s
টোকেন
635 tok

#111 LongCat 2.0

none
খরচ
$0.027
সময়
411.7s
টোকেন
22,283 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Gemini 3.1 Flash Lite 5.5 10.0 33.3% 0 831ms 8,126 666 0
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0

দ্রুত তুলনা

তুলনার জুটি বদলান