নেভিগেশন
AI BENCHY
Advertise here

Meituan: LongCat 2.0 vs Qwen: Qwen3.5-27B

average score প্রায় সমান: 7.4 vs 7.4. LongCat 2.0 (medium)-এর benchmark খরচ কম: $0.478 vs $1.627. Qwen3.5-27B (medium) দ্রুত: 111.94s vs 136.64s, pass rates 60.6% vs 72.7%.

প্রস্তাবিত মডেলLongCat 2.0 (medium)It has the best score here (7.4), while costing about 3.4x less than Qwen3.5-27B (medium).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-20

মেট্রিক LongCat 2.0 LongCat 2.0 medium প্রকাশ: 2026-07-20 Qwen3.5-27B Qwen3.5-27B medium প্রকাশ: 2026-02-24
স্কোর 7.4 7.4
র‍্যাঙ্ক #60 #58
নির্ভরযোগ্যতা 9.8 10.0
ধারাবাহিকতা 8.9 8.2
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 60.6% 72.7%
অস্থির টেস্ট 3 5
মোট রান 66 66
প্রতি ফলাফলে খরচ 3.978 8.324
মোট খরচ $0.478 $1.627
ইনপুট মূল্য $0.300 / 1M $0.260 / 1M
আউটপুট মূল্য $1.200 / 1M $2.600 / 1M
মোট ইনপুট টোকেন 97,315 111,635
আউটপুট টোকেন 44,384 15,999
রিজনিং টোকেন 329,012 598,430
প্রতিক্রিয়া সময় (গড়) 136.64s 111.94s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 939.52s 1026.43s
প্রতিক্রিয়া সময় (মোট) 3006.01s 2462.67s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#60 LongCat 2.0

medium
খরচ
$0.016
সময়
285.1s
টোকেন
13,057 tok

#58 Qwen3.5-27B

medium
খরচ
$0.008
সময়
62.0s
টোকেন
3,099 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143
Qwen3.5-27B 6.2 7.1 55.6% 1 160.69s 7,895 6,381 89,388

দ্রুত তুলনা

তুলনার জুটি বদলান