নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Google: Gemma 4 31B vs Meituan: LongCat 2.0

average score প্রায় সমান: 6.3 vs 6.3. LongCat 2.0-এর benchmark খরচ কম: $0.044 vs $0.163. LongCat 2.0 দ্রুত: 5.18s vs 75.38s, pass rates 68.2% vs 36.4%.

প্রস্তাবিত মডেলLongCat 2.0It has the best score here (6.3), while costing about 3.7x less than Gemma 4 31B (medium).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-20

মেট্রিক Gemma 4 31B Gemma 4 31B medium প্রকাশ: 2026-04-02 বিনামূল্যে উপলভ্য LongCat 2.0 LongCat 2.0 none প্রকাশ: 2026-07-20
স্কোর 6.3 6.3
র‍্যাঙ্ক #110 #111
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 9.0 9.3
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 68.2% 36.4%
অস্থির টেস্ট 2 2
মোট রান 66 66
প্রতি ফলাফলে খরচ 1.044 0.627
মোট খরচ $0.163 $0.044
ইনপুট মূল্য $0.220 / 1M $0.300 / 1M
আউটপুট মূল্য $0.550 / 1M $1.200 / 1M
মোট ইনপুট টোকেন 94,992 108,743
আউটপুট টোকেন 34,468 9,372
রিজনিং টোকেন 223,278 0
প্রতিক্রিয়া সময় (গড়) 75.38s 5.18s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 437.40s 48.38s
প্রতিক্রিয়া সময় (মোট) 1507.52s 113.95s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#110 Gemma 4 31B

medium
খরচ
$0.002
সময়
45.7s
টোকেন
2,696 tok

#111 LongCat 2.0

none
খরচ
$0.027
সময়
411.7s
টোকেন
22,283 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Gemma 4 31B 4.3 5.8 22.2% 1 219.76s 5,568 11,098 33,212
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0

দ্রুত তুলনা

তুলনার জুটি বদলান