#42 xAI: Grok Build 0.1
medium- খরচ
- $0.028
- সময়
- 81.3s
- টোকেন
- 14,009 tok
সারাংশ
Grok Build 0.1 AI BENCHY-তে 7.7 স্কোর করে এবং #42 স্থানে আছে। এর reliability 10.0, pass rate 65.0%, মোট খরচ $0.729, এবং গড় response time 42.39s.
Grok Build 0.1 কে আলাদা করে যা: এটি ডোমেইন-নির্দিষ্ট-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #4; আর কোডিং এর দুর্বলতম ক্ষেত্র, rank #18.
গবেষণার তারিখ: 2026-08-12
সর্বজনীন তথ্যপ্রমাণের ভিত্তিতে সেরা অনুমান; প্রদানকারী সব মান প্রকাশ করেনি।
7.7
ধারাবাহিকতা
9.9
10.0
$0.729
মোট আউটপুট টোকেন
343,639
মোট ইনপুট টোকেন
0
ইনপুট মূল্য
$1.000 / 1M
আউটপুট মূল্য
$2.000 / 1M
ক্যাশ পড়ার মূল্য
প্রযোজ্য নয়
ক্যাশ লেখার মূল্য
প্রযোজ্য নয়
ক্যাশের মূল্য ইনপুট টোকেনের জন্য প্রযোজ্য। পড়ার সময় ক্যাশ করা প্রম্পট আবার ব্যবহার হয়; লেখার সময় সেগুলি সংরক্ষিত হয় এবং বাড়তি খরচ হতে পারে। আউটপুট টোকেনের জন্য আউটপুট মূল্য প্রযোজ্য।
অস্থির টেস্ট
0
অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।
42.39s
প্রতিক্রিয়া সময় (সর্বোচ্চ): 252.69s
প্রতিক্রিয়া সময় (মোট): 847.76s
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
রান ইতিহাস
| পরীক্ষিত হয়েছে | স্কোর | নির্ভরযোগ্যতা | সঠিক টেস্ট | মোট খরচ | তুলনা করুন |
|---|---|---|---|---|---|
| 2026-08-14 02:58 পুনরায় পরীক্ষা | 7.5 | 10.0 | $1.130 | তুলনা করুন | |
| 2026-07-16 23:10 নতুন টেস্ট যোগ হয়েছে | 7.6 | 10.0 | $1.097 | তুলনা করুন | |
| 2026-06-04 14:22 নতুন টেস্ট যোগ হয়েছে | 7.4 | 10.0 | $0.927 | তুলনা করুন | |
| 2026-05-26 13:30 পুনরায় পরীক্ষা | 7.7 | 10.0 | $0.729 | বর্তমান রান | |
| 2026-05-22 00:36 স্যুইট পরিবর্তিত হয়েছে | 7.6 | 10.0 | $0.633 | তুলনা করুন |
রান তুলনা
| রান | বেঞ্চমার্ক কভারেজ | স্কোর | ধারাবাহিকতা | নির্ভরযোগ্যতা | সঠিক টেস্ট | অস্থির টেস্ট | মোট আউটপুট টোকেন | মোট ইনপুট টোকেন | মোট খরচ | প্রতিক্রিয়া সময় (গড়) |
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-05-26 13:30 · পুনরায় পরীক্ষা | 60/60 প্রচেষ্টা | 7.7 | 9.9 | 10.0 | 13/20 | 0 | 343,639 | 0 | $0.729 | 42.39s |
| 2026-06-04 14:22 · নতুন টেস্ট যোগ হয়েছে | 63/63 প্রচেষ্টা | 7.4 | 9.9 | 10.0 | 13/21 | 0 | 440,800 | 44,418 | $0.927 | 49.90s |
| পার্থক্য | — | +0.2 | 0.0 | 0.0 | 0 | 0 | -97161 | -44418 | -$0.198 | -7513ms |
বেঞ্চমার্ক কভারেজ আলাদা: 60/60 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি) বনাম 63/63 প্রচেষ্টা (লক্ষ্য: প্রতি টেস্টে 3টি পুনরাবৃত্তি)। মোট মান ও পুনরাবৃত্তি-সংবেদনশীল মেট্রিক সরাসরি তুলনাযোগ্য নয়।
এই দুই রান ভিন্ন বেঞ্চমার্ক স্যুইট ব্যবহার করেছে, তাই পার্থক্যগুলোতে মডেল পরিবর্তন এবং স্যুইট পরিবর্তন দুটোই ধরা পড়ে।
মূল্যের ইতিহাস
OpenRouter থেকে এই মডেলের ঐতিহাসিক মূল্য তথ্য।
| তারিখ | ইনপুট মূল্য | আউটপুট মূল্য | ক্যাশ পড়ার মূল্য | ক্যাশ লেখার মূল্য |
|---|---|---|---|---|
| 2026-05-27 12:57 | $1.000 / 1M | $2.000 / 1M | প্রযোজ্য নয় | প্রযোজ্য নয় |
প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।
| বিভাগ | স্কোর | ধারাবাহিকতা | সঠিক টেস্ট |
|---|---|---|---|
| অ্যান্টি-এআই কৌশল | 8.3 | 10.0 | |
| কোডিং | 7.0 | 9.5 | |
| সমন্বিত | 10.0 | 10.0 | |
| ডেটা পার্সিং ও নিষ্কাশন | 10.0 | 10.0 | |
| ডোমেইন-নির্দিষ্ট | 5.3 | 10.0 | |
| Sadharon Buddhimotta | 4.4 | 9.9 | |
| নির্দেশনা অনুসরণ | 9.8 | 10.0 | |
| ধাঁধা সমাধান | 7.7 | 10.0 | |
| টুল কলিং | 10.0 | 10.0 | |
| সাধারণ জ্ঞান | 3.0 | 10.0 |