নেভিগেশন
AI BENCHY
Advertise here

Meituan: LongCat 2.0 vs OpenAI: gpt-oss-120b

LongCat 2.0 average score-এ এগিয়ে: 6.3 vs 6.1. gpt-oss-120b (medium)-এর benchmark খরচ কম: $0.019 vs $0.044. LongCat 2.0 দ্রুত: 5.18s vs 21.91s, pass rates 36.4% vs 50.0%.

প্রস্তাবিত মডেলLongCat 2.0It has the best score here (6.3), while responding about 4.2x faster than gpt-oss-120b (medium).

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-20

মেট্রিক LongCat 2.0 LongCat 2.0 none প্রকাশ: 2026-07-20 gpt-oss-120b gpt-oss-120b medium প্রকাশ: 2025-08-05
স্কোর 6.3 6.1
র‍্যাঙ্ক #111 #121
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 9.3 8.0
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 36.4% 50.0%
অস্থির টেস্ট 2 5
মোট রান 66 66
প্রতি ফলাফলে খরচ 0.627 0.221
মোট খরচ $0.044 $0.019
ইনপুট মূল্য $0.300 / 1M $0.037 / 1M
আউটপুট মূল্য $1.200 / 1M $0.170 / 1M
মোট ইনপুট টোকেন 108,743 108,747
আউটপুট টোকেন 9,372 29,772
রিজনিং টোকেন 0 68,044
প্রতিক্রিয়া সময় (গড়) 5.18s 21.91s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 48.38s 68.16s
প্রতিক্রিয়া সময় (মোট) 113.95s 328.70s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#111 LongCat 2.0

none
খরচ
$0.027
সময়
411.7s
টোকেন
22,283 tok

#121 gpt-oss-120b

medium
খরচ
$0.001
সময়
26.7s
টোকেন
555 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
LongCat 2.0 5.5 10.0 33.3% 0 2.85s 7,446 578 0
gpt-oss-120b 5.9 7.0 55.6% 1 38.37s 7,782 3,365 11,973

দ্রুত তুলনা

তুলনার জুটি বদলান