সারাংশ
gpt-oss-120b AI BENCHY-তে 4.2 স্কোর করে এবং #361 স্থানে আছে। এর reliability 10.0, pass rate 34.8%, মোট খরচ $0.016, এবং গড় response time 28.63s.
gpt-oss-120b কে আলাদা করে যা: এটি স্বায়ত্তশাসিত এজেন্টের কাজ-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #1; আর কোডিং এর দুর্বলতম ক্ষেত্র, rank #10.
মডেলের তথ্য
গবেষণার তারিখ: 2026-08-12
- প্যারামিটার
- 117B মোট (5.1B সক্রিয়)
- আর্কিটেকচার
- MoE
- উপলভ্যতা
- উন্মুক্ত উৎস
- লাইসেন্স
- Apache-2.0
4.2
ধারাবাহিকতা
7.6
10.0
মোট আউটপুট টোকেন
62,213
মোট ইনপুট টোকেন
131,652
ইনপুট মূল্য
$0.037 / 1M
আউটপুট মূল্য
$0.170 / 1M
ক্যাশ পড়ার মূল্য
প্রযোজ্য নয়
ক্যাশ লেখার মূল্য
প্রযোজ্য নয়
ক্যাশের মূল্য ইনপুট টোকেনের জন্য প্রযোজ্য। পড়ার সময় ক্যাশ করা প্রম্পট আবার ব্যবহার হয়; লেখার সময় সেগুলি সংরক্ষিত হয় এবং বাড়তি খরচ হতে পারে। আউটপুট টোকেনের জন্য আউটপুট মূল্য প্রযোজ্য।
ভুল টেস্ট: 14
প্রতি চেষ্টায় পাস রেট: 34.8%
বেঞ্চমার্ক কভারেজ: 60/69 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)
অস্থির টেস্ট
3
অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।
28.63s
প্রতিক্রিয়া সময় (সর্বোচ্চ): 140.90s
প্রতিক্রিয়া সময় (মোট): 486.69s
রান ইতিহাস
| পরীক্ষিত হয়েছে | স্কোর | নির্ভরযোগ্যতা | সঠিক টেস্ট | মোট খরচ | তুলনা করুন |
|---|---|---|---|---|---|
| 2026-10-01 05:17 স্যুইট পরিবর্তিত হয়েছে | 4.2 | 10.0 | $0.016 ↓ | বর্তমান রান | |
| 2026-04-21 12:42 প্রথম নথিভুক্ত রান | 5.2 | প্রযোজ্য নয় | $0.009 | তুলনা করুন |
এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।
রান তুলনা
| রান | বেঞ্চমার্ক কভারেজ | স্কোর | ধারাবাহিকতা | নির্ভরযোগ্যতা | সঠিক টেস্ট | অস্থির টেস্ট | মোট আউটপুট টোকেন | মোট ইনপুট টোকেন | মোট খরচ | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-10-01 05:17 · বর্তমান রান | 60/69 প্রচেষ্টা | 4.2 | 7.6 | 10.0 | 6/20 | 3 | 62,213 | 131,652 | $0.016 | 28.63s |
| 2026-04-21 12:42 · প্রথম নথিভুক্ত রান | 54/54 প্রচেষ্টা | 5.2 | 7.9 | প্রযোজ্য নয় | 4/18 | 5 | 44,652 | 0 | $0.009 | 11.96s |
| পার্থক্য | — | -1.0 | -0.3 | +2 | -2 | +17561 | +131652 | +$0.007 | +16672ms |
বেঞ্চমার্ক কভারেজ আলাদা: 60/69 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 54/54 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।
এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।
মূল্যের ইতিহাস
OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।
| তারিখ | ইনপুট মূল্য | আউটপুট মূল্য | ক্যাশ পড়ার মূল্য | ক্যাশ লেখার মূল্য |
|---|---|---|---|---|
| 2026-06-04 15:40 | $0.039 / 1M | $0.180 / 1M | প্রযোজ্য নয় | প্রযোজ্য নয় |
| 2026-06-29 01:00 | $0.030 / 1M | $0.150 / 1M | প্রযোজ্য নয় | প্রযোজ্য নয় |
| 2026-07-09 20:59 | $0.036 / 1M | $0.180 / 1M | প্রযোজ্য নয় | প্রযোজ্য নয় |
| 2026-07-16 15:36 | $0.037 / 1M | $0.170 / 1M | প্রযোজ্য নয় | প্রযোজ্য নয় |
| 2026-08-12 11:59 | $0.030 / 1M | $0.170 / 1M | প্রযোজ্য নয় | প্রযোজ্য নয় |
চার্ট
প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।
স্কোর vs মোট খরচ
প্রতিক্রিয়া সময় (গড়)
স্কোর vs প্রতিক্রিয়া সময় (গড়)
মোট আউটপুট টোকেন
স্কোর vs মোট আউটপুট টোকেন
দ্রুত তুলনা
বিভাগভিত্তিক বিশ্লেষণ
| বিভাগ | স্কোর | ধারাবাহিকতা | সঠিক টেস্ট |
|---|---|---|---|
| স্বায়ত্তশাসিত এজেন্টের কাজ | 6.1 | 3.1 | |
| অ্যান্টি-এআই কৌশল | 6.5 | 10.0 | |
| কোডিং | 1.5 | 0.4 | |
| সমন্বিত | 1.5 | 5.0 | |
| ডেটা পার্সিং ও নিষ্কাশন | 6.5 | 10.0 | |
| ডোমেইন-নির্দিষ্ট | 3.0 | 10.0 | |
| Sadharon Buddhimotta | 4.8 | 10.0 | |
| নির্দেশনা অনুসরণ | 9.8 | 10.0 | |
| ধাঁধা সমাধান | 6.0 | 7.2 | |
| টুল কলিং | 3.0 | 10.0 | |
| সাধারণ জ্ঞান | 3.0 | 10.0 |