নেভিগেশন
AI BENCHY
Advertise here

Meituan: LongCat 2.0 vs Qwen: Qwen3.6 Max Preview

average score প্রায় সমান: 6.6 vs 6.6. Qwen3.6 Max Preview-এর benchmark খরচ কম: $0.231 vs $0.469. Qwen3.6 Max Preview দ্রুত: 7.82s vs 148.73s, pass rates 53.0% vs 60.6%.

প্রস্তাবিত মডেলQwen3.6 Max PreviewIt has the best score here (6.6), while costing about 2.0x less than LongCat 2.0 (high).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-20

মেট্রিক LongCat 2.0 LongCat 2.0 high প্রকাশ: 2026-07-20 Qwen3.6 Max Preview Qwen3.6 Max Preview none প্রকাশ: 2026-04-20
স্কোর 6.6 6.6
র‍্যাঙ্ক #97 #98
নির্ভরযোগ্যতা 9.4 9.9
ধারাবাহিকতা 8.2 9.3
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 53.0% 60.6%
অস্থির টেস্ট 5 2
মোট রান 66 66
প্রতি ফলাফলে খরচ 5.202 2.061
মোট খরচ $0.469 $0.231
ইনপুট মূল্য $0.300 / 1M $1.040 / 1M
আউটপুট মূল্য $1.200 / 1M $6.240 / 1M
মোট ইনপুট টোকেন 93,357 106,339
আউটপুট টোকেন 30,466 19,257
রিজনিং টোকেন 336,325 0
প্রতিক্রিয়া সময় (গড়) 148.73s 7.82s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 941.66s 102.62s
প্রতিক্রিয়া সময় (মোট) 3272.00s 172.01s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#97 LongCat 2.0

high
অবৈধ SVG
খরচ
$0.000
সময়
600.0s
টোকেন
0 tok

#98 Qwen3.6 Max Preview

none
খরচ
$0.025
সময়
83.9s
টোকেন
4,066 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
LongCat 2.0 7.6 7.2 77.8% 1 505.33s 6,913 244 192,377
Qwen3.6 Max Preview 3.8 7.3 22.2% 1 3.12s 7,913 456 0

দ্রুত তুলনা

তুলনার জুটি বদলান