AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#177

LongCat 2.0

Meituan প্রকাশ: 2026-07-20 পরীক্ষিত হয়েছে: 2026-08-14 03:58 meituan/longcat-2.0::none
1.6T মোট (48B সক্রিয়)MoEউন্মুক্ত উৎস

সারাংশ

LongCat 2.0 AI BENCHY-তে 6.4 স্কোর করে এবং #177 স্থানে আছে। এর reliability 10.0, pass rate 40.9%, মোট খরচ $0.044, এবং গড় response time 5.17s.

পরিচয় নোট

Owl Alpha ছিল LongCat 2.0-এর স্টেলথ সংস্করণ।

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

প্রকাশিত
প্যারামিটার
1.6T মোট (48B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
উন্মুক্ত উৎস
লাইসেন্স
MIT

ধারাবাহিকতা

9.3

মোট আউটপুট টোকেন

9,375

মোট ইনপুট টোকেন

108,752

ইনপুট মূল্য

$0.300 / 1M

আউটপুট মূল্য

$1.200 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 14

প্রতি চেষ্টায় পাস রেট: 40.9%

অস্থির টেস্ট

2

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

5.17s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 48.38s

প্রতিক্রিয়া সময় (মোট): 113.83s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#177 LongCat 2.0

none
খরচ
$0.027
সময়
411.7s
টোকেন
22,283 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-08-14 03:58 পুনরায় পরীক্ষা 6.4 10.0 $0.044 বর্তমান রান
2026-07-20 16:55 প্রথম রান 6.3 10.0 $0.044 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

মূল্যের ইতিহাস

OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।

তারিখ ইনপুট মূল্য আউটপুট মূল্য
2026-08-14 12:51 $0.300 / 1M $1.200 / 1M

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
অ্যান্টি-এআই কৌশল 4.8 10.0
কোডিং 5.5 10.0
সমন্বিত 6.5 10.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 5.3 10.0
Sadharon Buddhimotta 5.0 10.0
নির্দেশনা অনুসরণ 6.5 10.0
ধাঁধা সমাধান 4.0 5.0
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল