নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Meituan: LongCat 2.0 vs OpenAI: GPT-5.3 Chat

GPT-5.3 Chat average score-এ এগিয়ে: 7.5 vs 7.4. LongCat 2.0 (medium)-এর benchmark খরচ কম: $0.478 vs $0.571. GPT-5.3 Chat দ্রুত: 6.88s vs 136.64s, pass rates 60.6% vs 68.2%.

প্রস্তাবিত মডেলGPT-5.3 ChatIt has the best score here (7.5), while responding about 19.9x faster than LongCat 2.0 (medium).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-20

মেট্রিক LongCat 2.0 LongCat 2.0 medium প্রকাশ: 2026-07-20 GPT-5.3 Chat GPT-5.3 Chat none প্রকাশ: 2026-03-03
স্কোর 7.4 7.5
র‍্যাঙ্ক #60 #54
নির্ভরযোগ্যতা 9.8 10.0
ধারাবাহিকতা 8.9 8.2
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 60.6% 68.2%
অস্থির টেস্ট 3 5
মোট রান 66 66
প্রতি ফলাফলে খরচ 3.978 4.387
মোট খরচ $0.478 $0.571
ইনপুট মূল্য $0.300 / 1M $1.750 / 1M
আউটপুট মূল্য $1.200 / 1M $14.000 / 1M
মোট ইনপুট টোকেন 97,315 78,990
আউটপুট টোকেন 44,384 30,854
রিজনিং টোকেন 329,012 0
প্রতিক্রিয়া সময় (গড়) 136.64s 6.88s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 939.52s 18.33s
প্রতিক্রিয়া সময় (মোট) 3006.01s 151.31s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#60 LongCat 2.0

medium
খরচ
$0.016
সময়
285.1s
টোকেন
13,057 tok

#54 GPT-5.3 Chat

none
খরচ
$0.008
সময়
8.1s
টোকেন
634 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143
GPT-5.3 Chat 5.6 4.7 55.6% 2 10.52s 7,302 6,632 0

দ্রুত তুলনা

তুলনার জুটি বদলান