নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Meituan: LongCat 2.0 vs Qwen: Qwen3.6 27B

LongCat 2.0 (high) average score-এ এগিয়ে: 6.6 vs 6.5. LongCat 2.0 (high)-এর benchmark খরচ কম: $0.469 vs $0.779. Qwen3.6 27B (medium) দ্রুত: 106.32s vs 148.73s, pass rates 53.0% vs 59.1%.

প্রস্তাবিত মডেলLongCat 2.0 (high)It has the best score here (6.6), while costing about 1.7x less than Qwen3.6 27B (medium).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-20

মেট্রিক LongCat 2.0 LongCat 2.0 high প্রকাশ: 2026-07-20 Qwen3.6 27B Qwen3.6 27B medium প্রকাশ: 2026-04-20
স্কোর 6.6 6.5
র‍্যাঙ্ক #97 #99
নির্ভরযোগ্যতা 9.4 10.0
ধারাবাহিকতা 8.2 8.0
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 53.0% 59.1%
অস্থির টেস্ট 5 6
মোট রান 66 66
প্রতি ফলাফলে খরচ 5.202 7.319
মোট খরচ $0.469 $0.779
ইনপুট মূল্য $0.300 / 1M $0.450 / 1M
আউটপুট মূল্য $1.200 / 1M $2.700 / 1M
মোট ইনপুট টোকেন 93,357 106,167
আউটপুট টোকেন 30,466 32,889
রিজনিং টোকেন 336,325 241,303
প্রতিক্রিয়া সময় (গড়) 148.73s 106.32s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 941.66s 1085.11s
প্রতিক্রিয়া সময় (মোট) 3272.00s 2339.12s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#97 LongCat 2.0

high
অবৈধ SVG
খরচ
$0.000
সময়
600.0s
টোকেন
0 tok

#99 Qwen3.6 27B

medium
খরচ
$0.009
সময়
39.6s
টোকেন
3,090 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
LongCat 2.0 7.6 7.2 77.8% 1 505.33s 6,913 244 192,377
Qwen3.6 27B 7.7 10.0 66.7% 0 142.99s 5,051 7,968 43,367

দ্রুত তুলনা

তুলনার জুটি বদলান