Advertise here
#116

Grok 4.5

X AI প্রকাশ: 2026-07-08 পরীক্ষিত হয়েছে: 2026-10-01 02:38 x-ai/grok-4.5::low
~1.7T মোট (~170B সক্রিয়)MoEবন্ধ উৎসআনুমানিক

সারাংশ

Grok 4.5 AI BENCHY-তে 7.8 স্কোর করে এবং #116 স্থানে আছে। এর reliability 10.0, pass rate 73.9%, মোট খরচ $1.345, এবং গড় response time 18.14s.

Grok 4.5 কে আলাদা করে যা: এটি কোডিং-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #1; আর স্বায়ত্তশাসিত এজেন্টের কাজ এর দুর্বলতম ক্ষেত্র, rank #14.

মডেলের তথ্য

গবেষণার তারিখ: 2026-08-12

আনুমানিক
প্যারামিটার
~1.7T মোট (~170B সক্রিয়)
আর্কিটেকচার
MoE
উপলভ্যতা
বন্ধ উৎস
লাইসেন্স
-

সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।

ধারাবাহিকতা

9.3

মোট আউটপুট টোকেন

121,415

মোট ইনপুট টোকেন

308,068

ইনপুট মূল্য

$2.000 / 1M

আউটপুট মূল্য

$6.000 / 1M

ক্যাশ পড়ার মূল্য

$0.300 / 1M

ক্যাশ লেখার মূল্য

প্রযোজ্য নয়

ক্যাশের মূল্য ইনপুট টোকেনের জন্য প্রযোজ্য। পড়ার সময় ক্যাশ করা প্রম্পট আবার ব্যবহার হয়; লেখার সময় সেগুলি সংরক্ষিত হয় এবং বাড়তি খরচ হতে পারে। আউটপুট টোকেনের জন্য আউটপুট মূল্য প্রযোজ্য।

সঠিক টেস্ট

ভুল টেস্ট: 7

প্রতি চেষ্টায় পাস রেট: 73.9%

অস্থির টেস্ট

2

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

18.14s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 205.28s

প্রতিক্রিয়া সময় (মোট): 417.21s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#116 SpaceXAI: Grok 4.5

low
খরচ
$0.011
সময়
12.4s
টোকেন
2,018 tok

রান ইতিহাস

পরীক্ষিত হয়েছে স্কোর নির্ভরযোগ্যতা সঠিক টেস্ট মোট খরচ তুলনা করুন
2026-10-01 02:38 পুনরায় পরীক্ষা 7.8 10.0 $1.345 বর্তমান রান
2026-07-16 23:08 নতুন টেস্ট যোগ হয়েছে 8.4 10.0 $0.935 তুলনা করুন
2026-07-08 22:51 প্রথম রান 7.8 10.0 $0.760 তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

রান তুলনা

রানবেঞ্চমার্ক কভারেজস্কোরধারাবাহিকতানির্ভরযোগ্যতাসঠিক টেস্টঅস্থির টেস্টমোট আউটপুট টোকেনমোট ইনপুট টোকেনমোট খরচপ্রতিক্রিয়া সময় (গড়)
2026-10-01 02:38 · বর্তমান রান69/69 প্রচেষ্টা7.89.310.016/232121,415308,068$1.34518.14s
2026-07-08 22:51 · প্রথম রান63/63 প্রচেষ্টা7.89.710.015/211106,96858,652$0.76015.48s
পার্থক্য—0.0-0.40.0+1+1+14447+249416+$0.586+2664ms

বেঞ্চমার্ক কভারেজ আলাদা: 69/69 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।

এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।

মূল্যের ইতিহাস

OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।

তারিখ ইনপুট মূল্য আউটপুট মূল্য ক্যাশ পড়ার মূল্য ক্যাশ লেখার মূল্য
2026-08-14 12:51 $2.000 / 1M $6.000 / 1M প্রযোজ্য নয় প্রযোজ্য নয়
2026-10-01 18:33 $2.000 / 1M $6.000 / 1M $0.300 / 1M প্রযোজ্য নয়

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ স্কোর ধারাবাহিকতা সঠিক টেস্ট
স্বায়ত্তশাসিত এজেন্টের কাজ 5.0 10.0
অ্যান্টি-এআই কৌশল 10.0 10.0
কোডিং 10.0 10.0
সমন্বিত 6.5 10.0
ডেটা পার্সিং ও নিষ্কাশন 10.0 10.0
ডোমেইন-নির্দিষ্ট 2.9 7.2
Sadharon Buddhimotta 6.1 3.1
নির্দেশনা অনুসরণ 9.8 10.0
ধাঁধা সমাধান 10.0 10.0
টুল কলিং 10.0 10.0
সাধারণ জ্ঞান 3.0 10.0

তুলনা করা মডেল