নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Meituan: LongCat 2.0 vs OpenAI: GPT-5.6 Luna

LongCat 2.0 average score-এ এগিয়ে: 6.3 vs 6.2. LongCat 2.0-এর benchmark খরচ কম: $0.044 vs $0.249. GPT-5.6 Luna (low) দ্রুত: 5.04s vs 5.18s, pass rates 36.4% vs 56.1%.

প্রস্তাবিত মডেলLongCat 2.0It has the best score here (6.3), while costing about 5.7x less than GPT-5.6 Luna (low).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-20

মেট্রিক LongCat 2.0 LongCat 2.0 none প্রকাশ: 2026-07-20 GPT-5.6 Luna GPT-5.6 Luna low প্রকাশ: 2026-07-09
স্কোর 6.3 6.2
র‍্যাঙ্ক #111 #117
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 9.3 8.2
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 36.4% 56.1%
অস্থির টেস্ট 2 5
মোট রান 66 66
প্রতি ফলাফলে খরচ 0.627 2.490
মোট খরচ $0.044 $0.249
ইনপুট মূল্য $0.300 / 1M $1.000 / 1M
আউটপুট মূল্য $1.200 / 1M $6.000 / 1M
মোট ইনপুট টোকেন 108,743 96,346
আউটপুট টোকেন 9,372 8,211
রিজনিং টোকেন 0 17,227
প্রতিক্রিয়া সময় (গড়) 5.18s 5.04s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 48.38s 19.44s
প্রতিক্রিয়া সময় (মোট) 113.95s 110.88s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#111 LongCat 2.0

none
খরচ
$0.027
সময়
411.7s
টোকেন
22,283 tok

#117 GPT-5.6 Luna

low
খরচ
$0.011
সময়
10.2s
টোকেন
1,897 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0
GPT-5.6 Luna 5.5 10.0 33.3% 0 4.61s 7,302 557 3,535

দ্রুত তুলনা

তুলনার জুটি বদলান