নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Meituan: LongCat 2.0 vs Qwen: Qwen3.6 27B

LongCat 2.0 (low) average score-এ এগিয়ে: 6.7 vs 6.5. LongCat 2.0 (low)-এর benchmark খরচ কম: $0.391 vs $0.779. LongCat 2.0 (low) দ্রুত: 100.31s vs 106.32s, pass rates 53.0% vs 59.1%.

প্রস্তাবিত মডেলLongCat 2.0 (low)It has the best score here (6.7), while costing about 2.0x less than Qwen3.6 27B (medium).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-21

মেট্রিক LongCat 2.0 LongCat 2.0 low প্রকাশ: 2026-07-20 Qwen3.6 27B Qwen3.6 27B medium প্রকাশ: 2026-04-20
স্কোর 6.7 6.5
র‍্যাঙ্ক #96 #105
নির্ভরযোগ্যতা 9.6 10.0
ধারাবাহিকতা 8.9 8.0
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 53.0% 59.1%
অস্থির টেস্ট 3 6
মোট রান 66 66
প্রতি ফলাফলে খরচ 3.910 7.319
মোট খরচ $0.391 $0.779
ইনপুট মূল্য $0.300 / 1M $0.450 / 1M
আউটপুট মূল্য $1.200 / 1M $2.700 / 1M
মোট ইনপুট টোকেন 90,909 106,167
আউটপুট টোকেন 5,679 32,889
রিজনিং টোকেন 297,369 241,303
প্রতিক্রিয়া সময় (গড়) 100.31s 106.32s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 560.39s 1085.11s
প্রতিক্রিয়া সময় (মোট) 2206.82s 2339.12s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#96 LongCat 2.0

low
খরচ
$0.024
সময়
428.0s
টোকেন
19,557 tok

#105 Qwen3.6 27B

medium
খরচ
$0.009
সময়
39.6s
টোকেন
3,090 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
LongCat 2.0 6.6 4.6 77.8% 2 479.30s 6,544 461 206,627
Qwen3.6 27B 7.7 10.0 66.7% 0 142.99s 5,051 7,968 43,367

দ্রুত তুলনা

তুলনার জুটি বদলান