AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#361

gpt-oss-120b

OpenAI প্রকাশ: 2025-08-05 পরীক্ষিত হয়েছে: 2026-10-01 05:17 openai/gpt-oss-120b::none
117B মোট (5.1B সক্রিয়)MoEউন্মুক্ত উৎস
(medium) (none)

সারাংশ

gpt-oss-120b AI BENCHY-তে 4.2 স্কোর করে এবং #361 স্থানে আছে। এর reliability 10.0, pass rate 34.8%, মোট খরচ $0.016, এবং গড় response time 28.63s.

gpt-oss-120b কে আলাদা করে যা: এটি স্বায়ত্তশাসিত এজেন্টের কাজ-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #1; আর কোডিং এর দুর্বলতম ক্ষেত্র, rank #10.

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

প্রকাশিত
প্যারামিটার
117B মোট (5.1B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
উন্মুক্ত উৎস
লাইসেন্স
Apache-2.0

ধারাবাহিকতা

7.6

মোট খরচ (বর্তমান মূল্য)

$0.016 ↓ -5.7%

পরীক্ষার সময়: $0.017

মোট আউটপুট টোকেন

62,213

মোট ইনপুট টোকেন

131,652

ইনপুট মূল্য

$0.037 / 1M

আউটপুট মূল্য

$0.170 / 1M

ক্যাশ পড়ার মূল্য

প্রযোজ্য নয়

ক্যাশ লেখার মূল্য

প্রযোজ্য নয়

ক্যাশের মূল্য ইনপুট টোকেনের জন্য প্রযোজ্য। পড়ার সময় ক্যাশ করা প্রম্পট আবার ব্যবহার হয়; লেখার সময় সেগুলি সংরক্ষিত হয় এবং বাড়তি খরচ হতে পারে। আউটপুট টোকেনের জন্য আউটপুট মূল্য প্রযোজ্য।

সঠিক টেস্ট

ভুল টেস্ট: 14

প্রতি চেষ্টায় পাস রেট: 34.8%

বেঞ্চমার্ক কভারেজ: 60/69 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)

অস্থির টেস্ট

3

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

28.63s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 140.90s

প্রতিক্রিয়া সময় (মোট): 486.69s

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-10-01 05:17 স্যুইট পরিবর্তিত হয়েছে 4.2 10.0 $0.016 ↓ বর্তমান রান
2026-04-21 12:42 প্রথম নথিভুক্ত রান 5.2 প্রযোজ্য নয় $0.009 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-10-01 05:17 · বর্তমান রান60/69 প্রচেষ্টা4.27.610.06/20362,213131,652$0.01628.63s
2026-04-21 12:42 · প্রথম নথিভুক্ত রান54/54 প্রচেষ্টা5.27.9প্রযোজ্য নয়4/18544,6520$0.00911.96s
পার্থক্য—-1.0-0.3+2-2+17561+131652+$0.007+16672ms

বেঞ্চমার্ক কভারেজ আলাদা: 60/69 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 54/54 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

মূল্যের ইতিহাস

OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।

তারিখ ইনপুট মূল্য আউটপুট মূল্য ক্যাশ পড়ার মূল্য ক্যাশ লেখার মূল্য
2026-06-04 15:40 $0.039 / 1M $0.180 / 1M প্রযোজ্য নয় প্রযোজ্য নয়
2026-06-29 01:00 $0.030 / 1M $0.150 / 1M প্রযোজ্য নয় প্রযোজ্য নয়
2026-07-09 20:59 $0.036 / 1M $0.180 / 1M প্রযোজ্য নয় প্রযোজ্য নয়
2026-07-16 15:36 $0.037 / 1M $0.170 / 1M প্রযোজ্য নয় প্রযোজ্য নয়
2026-08-12 11:59 $0.030 / 1M $0.170 / 1M প্রযোজ্য নয় প্রযোজ্য নয়

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
স্বায়ত্তশাসিত এজেন্টের কাজ 6.1 3.1
অ্যান্টি-এআই কৌশল 6.5 10.0
কোডিং 1.5 0.4
সমন্বিত 1.5 5.0
ডেটা পার্সিং ও নিষ্কাশন 6.5 10.0
ডোমেইন-নির্দিষ্ট 3.0 10.0
Sadharon Buddhimotta 4.8 10.0
নির্দেশনা অনুসরণ 9.8 10.0
ধাঁধা সমাধান 6.0 7.2
টুল কলিং 3.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল