নেভিগেশন
AI BENCHY
Advertise here

Meituan: LongCat 2.0 vs Qwen: Qwen3.5-Flash

average score প্রায় সমান: 6.3 vs 6.2. LongCat 2.0-এর benchmark খরচ কম: $0.044 vs $0.139. LongCat 2.0 দ্রুত: 5.18s vs 84.82s, pass rates 36.4% vs 69.7%.

প্রস্তাবিত মডেলLongCat 2.0It has the best score here (6.3), while costing about 3.2x less than Qwen3.5-Flash (medium).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-20

মেট্রিক LongCat 2.0 LongCat 2.0 none প্রকাশ: 2026-07-20 Qwen3.5-Flash Qwen3.5-Flash medium প্রকাশ: 2026-02-24
স্কোর 6.3 6.2
র‍্যাঙ্ক #111 #114
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 9.3 7.8
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 36.4% 69.7%
অস্থির টেস্ট 2 6
মোট রান 66 66
প্রতি ফলাফলে খরচ 0.627 1.361
মোট খরচ $0.044 $0.139
ইনপুট মূল্য $0.300 / 1M $0.065 / 1M
আউটপুট মূল্য $1.200 / 1M $0.260 / 1M
মোট ইনপুট টোকেন 108,743 118,499
আউটপুট টোকেন 9,372 12,284
রিজনিং টোকেন 0 490,610
প্রতিক্রিয়া সময় (গড়) 5.18s 84.82s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 48.38s 515.38s
প্রতিক্রিয়া সময় (মোট) 113.95s 1781.22s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#111 LongCat 2.0

none
খরচ
$0.027
সময়
411.7s
টোকেন
22,283 tok

#114 Qwen3.5-Flash

medium
খরচ
$0.002
সময়
25.8s
টোকেন
4,294 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0
Qwen3.5-Flash 3.7 7.2 22.2% 1 58.87s 6,685 302 90,081

দ্রুত তুলনা

তুলনার জুটি বদলান