নেভিগেশন
AI BENCHY
Advertise here

Anthropic: Claude Sonnet 4.6 vs Meituan: LongCat 2.0

LongCat 2.0 (medium) average score-এ এগিয়ে: 7.4 vs 7.3. LongCat 2.0 (medium)-এর benchmark খরচ কম: $0.478 vs $0.661. Claude Sonnet 4.6 দ্রুত: 8.12s vs 136.64s, pass rates 57.6% vs 60.6%.

প্রস্তাবিত মডেলClaude Sonnet 4.6Its score stays close to the best score here (7.3 vs 7.4), while responding about 16.8x faster than LongCat 2.0 (medium).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-20

মেট্রিক Claude Sonnet 4.6 Claude Sonnet 4.6 none প্রকাশ: 2026-02-17 LongCat 2.0 LongCat 2.0 medium প্রকাশ: 2026-07-20
স্কোর 7.3 7.4
র‍্যাঙ্ক #63 #60
নির্ভরযোগ্যতা 10.0 9.8
ধারাবাহিকতা 9.7 8.9
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 57.6% 60.6%
অস্থির টেস্ট 1 3
মোট রান 66 66
প্রতি ফলাফলে খরচ 5.502 3.978
মোট খরচ $0.661 $0.478
ইনপুট মূল্য $3.000 / 1M $0.300 / 1M
আউটপুট মূল্য $15.000 / 1M $1.200 / 1M
মোট ইনপুট টোকেন 123,264 97,315
আউটপুট টোকেন 19,362 44,384
রিজনিং টোকেন 0 329,012
প্রতিক্রিয়া সময় (গড়) 8.12s 136.64s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 51.18s 939.52s
প্রতিক্রিয়া সময় (মোট) 121.78s 3006.01s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#63 Claude Sonnet 4.6

none
খরচ
$0.038
সময়
27.3s
টোকেন
2,598 tok

#60 LongCat 2.0

medium
খরচ
$0.016
সময়
285.1s
টোকেন
13,057 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Claude Sonnet 4.6 5.5 10.0 33.3% 0 5.19s 8,522 2,127 0
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143

দ্রুত তুলনা

তুলনার জুটি বদলান