#23 xAI: Grok 4.5
medium- খরচ
- $0.044
- সময়
- 59.4s
- টোকেন
- 7,512 tok
সারাংশ
Grok 4.5 AI BENCHY-তে 8.3 স্কোর করে এবং #23 স্থানে আছে। এর reliability 9.6, pass rate 77.8%, মোট খরচ $1.327, এবং গড় response time 63.50s.
গবেষণার তারিখ: 2026-08-12
সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।
8.3
ধারাবাহিকতা
8.9
$1.327
মোট আউটপুট টোকেন
203,365
মোট ইনপুট টোকেন
53,198
ইনপুট মূল্য
$2.000 / 1M
আউটপুট মূল্য
$6.000 / 1M
ক্যাশ পড়ার মূল্য
প্রযোজ্য নয়
ক্যাশ লেখার মূল্য
প্রযোজ্য নয়
ক্যাশের মূল্য ইনপুট টোকেনের জন্য প্রযোজ্য। পড়ার সময় ক্যাশ করা প্রম্পট আবার ব্যবহার হয়; লেখার সময় সেগুলি সংরক্ষিত হয় এবং বাড়তি খরচ হতে পারে। আউটপুট টোকেনের জন্য আউটপুট মূল্য প্রযোজ্য।
অস্থির টেস্ট
3
অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।
63.50s
প্রতিক্রিয়া সময় (সর্বোচ্চ): 454.61s
প্রতিক্রিয়া সময় (মোট): 1333.43s
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
রান ইতিহাস
| পরীক্ষিত হয়েছে | স্কোর | নির্ভরযোগ্যতা | সঠিক টেস্ট | মোট খরচ | তুলনা করুন |
|---|---|---|---|---|---|
| 2026-08-14 03:04 পুনরায় পরীক্ষা | 8.5 | 10.0 | $2.042 | তুলনা করুন | |
| 2026-07-16 23:09 নতুন টেস্ট যোগ হয়েছে | 8.3 | 10.0 | $1.928 | তুলনা করুন | |
| 2026-07-08 23:28 পুনরায় পরীক্ষা | 8.3 | 9.9 | $1.696 | তুলনা করুন | |
| 2026-07-08 21:34 প্রথম রান | 8.3 | 9.6 | $1.327 | বর্তমান রান |
রান তুলনা
| রান | বেঞ্চমার্ক কভারেজ | স্কোর | ধারাবাহিকতা | নির্ভরযোগ্যতা | সঠিক টেস্ট | অস্থির টেস্ট | মোট আউটপুট টোকেন | মোট ইনপুট টোকেন | মোট খরচ | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-07-08 21:34 · প্রথম রান | 63/63 প্রচেষ্টা | 8.3 | 8.9 | 9.6 | 15/21 | 3 | 203,365 | 53,198 | $1.327 | 63.50s |
| 2026-08-14 03:04 · পুনরায় পরীক্ষা | 66/66 প্রচেষ্টা | 8.5 | 8.9 | 10.0 | 17/22 | 3 | 299,460 | 122,155 | $2.042 | 68.59s |
| পার্থক্য | — | -0.1 | 0.0 | -0.4 | -2 | 0 | -96095 | -68957 | -$0.715 | -5090ms |
বেঞ্চমার্ক কভারেজ আলাদা: 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 66/66 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।
এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।
মূল্যের ইতিহাস
OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।
| তারিখ | ইনপুট মূল্য | আউটপুট মূল্য | ক্যাশ পড়ার মূল্য | ক্যাশ লেখার মূল্য |
|---|---|---|---|---|
| 2026-07-08 21:47 | $2.000 / 1M | $6.000 / 1M | প্রযোজ্য নয় | প্রযোজ্য নয় |
প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।
| বিভাগ | স্কোর | ধারাবাহিকতা | সঠিক টেস্ট |
|---|---|---|---|
| অ্যান্টি-এআই কৌশল | 10.0 | 10.0 | |
| কোডিং | 7.6 | 7.2 | |
| সমন্বিত | 10.0 | 10.0 | |
| ডেটা পার্সিং ও নিষ্কাশন | 10.0 | 10.0 | |
| ডোমেইন-নির্দিষ্ট | 2.9 | 7.2 | |
| Sadharon Buddhimotta | 6.5 | 3.4 | |
| নির্দেশনা অনুসরণ | 9.8 | 10.0 | |
| ধাঁধা সমাধান | 10.0 | 10.0 | |
| টুল কলিং | 10.0 | 10.0 | |
| সাধারণ জ্ঞান | 3.0 | 10.0 |