#112

gpt-oss-120b

OpenAI প্রকাশ: 2025-08-05 পরীক্ষিত হয়েছে: 2026-05-22 00:18 openai/gpt-oss-120b::medium

(medium) (none)

সারাংশ

gpt-oss-120b AI BENCHY-তে 5.6 স্কোর করে এবং #112 স্থানে আছে। এর reliability 10.0, pass rate 46.7%, মোট খরচ $0.012, এবং গড় response time 20.89s.

gpt-oss-120b কে আলাদা করে যা: এটি সমন্বিত-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #1; আর ডেটা পার্সিং ও নিষ্কাশন এর দুর্বলতম ক্ষেত্র, rank #11. এই score range-এর জন্য মোট benchmark খরচ অস্বাভাবিকভাবে কম। এটি অস্বাভাবিকভাবে বেশি reasoning tokens ব্যবহার করে, যা ধীর বা বেশি খরচের runs ব্যাখ্যা করতে পারে।

স্কোর

5.6

ধারাবাহিকতা

7.5

নির্ভরযোগ্যতা

10.0

মোট খরচ (বর্তমান মূল্য)

$0.012

মোট আউটপুট টোকেন

63,919

মোট ইনপুট টোকেন

ইনপুট মূল্য

$0.000 / 1M

আউটপুট মূল্য

$0.000 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 13

প্রতি চেষ্টায় পাস রেট: 46.7%

অস্থির টেস্ট

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

20.89s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 68.16s

প্রতিক্রিয়া সময় (মোট): 271.54s

ভুল উত্তর: 9 নির্দেশনা অনুসরণ করা হয়নি: 4

জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#112 gpt-oss-120b

medium

খরচ: $0.001
সময়: 26.7s
টোকেন: 555 tok

রান ইতিহাস

পরীক্ষিত হয়েছে	স্কোর	নির্ভরযোগ্যতা	মোট খরচ	তুলনা করুন
2026-06-04 13:44 নতুন টেস্ট যোগ হয়েছে	6.1	10.0	$0.013 ↓	তুলনা করুন
2026-05-22 00:18 স্যুইট পরিবর্তিত হয়েছে	5.6	10.0	$0.012	বর্তমান রান
2026-04-21 12:42 প্রথম নথিভুক্ত রান	5.8	প্রযোজ্য নয়	$0.011	তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ	স্কোর	ধারাবাহিকতা
অ্যান্টি-এআই কৌশল	6.7	9.9
কোডিং	3.9	5.6
সমন্বিত	10.0	10.0
ডেটা পার্সিং ও নিষ্কাশন	6.4	5.9
ডোমেইন-নির্দিষ্ট	2.9	4.4
Sadharon Buddhimotta	4.3	10.0
নির্দেশনা অনুসরণ	9.9	10.0
ধাঁধা সমাধান	3.2	4.7
টুল কলিং	9.8	10.0
সাধারণ জ্ঞান	3.0	10.0

gpt-oss-120b

Hamster playing table tennis

#112 gpt-oss-120b

চার্ট

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর vs মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

তুলনা করা মডেল