- স্কোর
- 5.2 (+0.23 পয়েন্ট)
- মোট খরচ (বর্তমান মূল্য)
- $0.004 · 85.8% সস্তা
- প্রতিক্রিয়া সময় (গড়)
- 3.40s · 18.3% দ্রুত
সারাংশ
GPT-4o-mini AI BENCHY-তে 5.0 স্কোর করে এবং #308 স্থানে আছে। এর reliability 10.0, pass rate 21.7%, মোট খরচ $0.024, এবং গড় response time 4.16s.
GPT-4o-mini কে আলাদা করে যা: এটি স্বায়ত্তশাসিত এজেন্টের কাজ-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #2; আর কোডিং এর দুর্বলতম ক্ষেত্র, rank #15.
প্রস্তাবিত বিকল্প
এর বদলে এই মডেলগুলির একটি বেছে নেওয়ার পরামর্শ দিই:
- স্কোর
- 5.3 (+0.30 পয়েন্ট)
- মোট খরচ (বর্তমান মূল্য)
- $0.020 · 20.7% সস্তা
- প্রতিক্রিয়া সময় (গড়)
- 4.56s · 9.6% ধীর
মডেলের তথ্য
গবেষণার তারিখ: 2026-08-12
- প্যারামিটার
- ~8B
- আর্কিটেকচার
- ঘন
- উপলভ্যতা
- বন্ধ উৎস
- লাইসেন্স
- -
সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।
5.0
ধারাবাহিকতা
9.9
10.0
$0.024
মোট আউটপুট টোকেন
3,627
মোট ইনপুট টোকেন
145,180
ইনপুট মূল্য
$0.150 / 1M
আউটপুট মূল্য
$0.600 / 1M
ক্যাশ পড়ার মূল্য
$0.075 / 1M
ক্যাশ লেখার মূল্য
প্রযোজ্য নয়
ক্যাশের মূল্য ইনপুট টোকেনের জন্য প্রযোজ্য। পড়ার সময় ক্যাশ করা প্রম্পট আবার ব্যবহার হয়; লেখার সময় সেগুলি সংরক্ষিত হয় এবং বাড়তি খরচ হতে পারে। আউটপুট টোকেনের জন্য আউটপুট মূল্য প্রযোজ্য।
অস্থির টেস্ট
0
অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#308 GPT-4o-mini
none- খরচ
- $0.001
- সময়
- 6.6s
- টোকেন
- 742 tok
রান ইতিহাস
| পরীক্ষিত হয়েছে | স্কোর | নির্ভরযোগ্যতা | সঠিক টেস্ট | মোট খরচ | তুলনা করুন |
|---|---|---|---|---|---|
| 2026-09-30 23:55 পুনরায় পরীক্ষা | 5.0 | 10.0 | $0.024 | বর্তমান রান | |
| 2026-07-16 21:13 নতুন টেস্ট যোগ হয়েছে | 5.0 | 10.0 | $0.010 | তুলনা করুন | |
| 2026-06-04 13:04 নতুন টেস্ট যোগ হয়েছে | 4.8 | 10.0 | $0.006 | তুলনা করুন | |
| 2026-05-21 23:41 স্যুইট পরিবর্তিত হয়েছে | 4.9 | 10.0 | $0.006 | তুলনা করুন | |
| 2026-04-11 01:19 প্রথম নথিভুক্ত রান | 4.9 | প্রযোজ্য নয় | $0.005 | তুলনা করুন |
এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।
রান তুলনা
| রান | বেঞ্চমার্ক কভারেজ | স্কোর | ধারাবাহিকতা | নির্ভরযোগ্যতা | সঠিক টেস্ট | অস্থির টেস্ট | মোট আউটপুট টোকেন | মোট ইনপুট টোকেন | মোট খরচ | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-09-30 23:55 · বর্তমান রান | 69/69 প্রচেষ্টা | 5.0 | 9.9 | 10.0 | 5/23 | 0 | 3,627 | 145,180 | $0.024 | 4.16s |
| 2026-06-04 13:04 · নতুন টেস্ট যোগ হয়েছে | 63/63 প্রচেষ্টা | 4.8 | 9.9 | 10.0 | 5/21 | 0 | 1,982 | 31,518 | $0.006 | 1.77s |
| পার্থক্য | — | +0.2 | 0.0 | 0.0 | 0 | 0 | +1645 | +113662 | +$0.019 | +2387ms |
বেঞ্চমার্ক কভারেজ আলাদা: 69/69 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।
এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।
মূল্যের ইতিহাস
OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।
| তারিখ | ইনপুট মূল্য | আউটপুট মূল্য | ক্যাশ পড়ার মূল্য | ক্যাশ লেখার মূল্য |
|---|---|---|---|---|
| 2026-08-14 12:51 | $0.150 / 1M | $0.600 / 1M | প্রযোজ্য নয় | প্রযোজ্য নয় |
| 2026-10-01 18:33 | $0.150 / 1M | $0.600 / 1M | $0.075 / 1M | প্রযোজ্য নয় |
চার্ট
প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।
স্কোর অনুযায়ী শীর্ষ মডেল
স্কোর vs মোট খরচ
প্রতিক্রিয়া সময় (গড়)
স্কোর vs প্রতিক্রিয়া সময় (গড়)
মোট আউটপুট টোকেন
স্কোর vs মোট আউটপুট টোকেন
দ্রুত তুলনা
বিভাগভিত্তিক বিশ্লেষণ
| বিভাগ | স্কোর | ধারাবাহিকতা | সঠিক টেস্ট |
|---|---|---|---|
| স্বায়ত্তশাসিত এজেন্টের কাজ | 5.0 | 10.0 | |
| অ্যান্টি-এআই কৌশল | 4.8 | 10.0 | |
| কোডিং | 3.2 | 9.6 | |
| সমন্বিত | 3.0 | 10.0 | |
| ডেটা পার্সিং ও নিষ্কাশন | 10.0 | 10.0 | |
| ডোমেইন-নির্দিষ্ট | 3.0 | 10.0 | |
| Sadharon Buddhimotta | 4.0 | 10.0 | |
| নির্দেশনা অনুসরণ | 6.3 | 10.0 | |
| ধাঁধা সমাধান | 3.5 | 10.0 | |
| টুল কলিং | 10.0 | 10.0 | |
| সাধারণ জ্ঞান | 3.0 | 10.0 |