Gemini 3.1 Pro Preview

Google প্রকাশ: 2026-02-19 পরীক্ষিত হয়েছে: 2026-05-22 00:30 google/gemini-3.1-pro-preview::medium

সারাংশ

Gemini 3.1 Pro Preview AI BENCHY-তে 9.3 স্কোর করে এবং #4 স্থানে আছে। এর reliability 10.0, pass rate 90.0%, মোট খরচ $1.006, এবং গড় response time 20.80s.

Gemini 3.1 Pro Preview কে আলাদা করে যা: এটি ডোমেইন-নির্দিষ্ট-তে সবচেয়ে ভালোভাবে নজর কাড়ে, যেখানে এর rank #2; আর কোডিং এর দুর্বলতম ক্ষেত্র, rank #13. এটি সামগ্রিকভাবে সর্বোচ্চ rank করা মডেলগুলোর একটি।

স্কোর

9.3

ধারাবাহিকতা

10.0

নির্ভরযোগ্যতা

10.0

মোট খরচ (বর্তমান মূল্য)

$1.006

মোট আউটপুট টোকেন

77,341

মোট ইনপুট টোকেন

ইনপুট মূল্য

$2.000 / 1M

আউটপুট মূল্য

$12.000 / 1M

সঠিক টেস্ট

ভুল টেস্ট: 2

প্রতি চেষ্টায় পাস রেট: 90.0%

অস্থির টেস্ট

অস্থির টেস্টে রানভেদে মিশ্র ফল হয়েছে (কমপক্ষে একটি পাস এবং একটি ফেল)।

প্রতিক্রিয়া সময় (গড়)

20.80s

প্রতিক্রিয়া সময় (সর্বোচ্চ): 88.68s

প্রতিক্রিয়া সময় (মোট): 270.46s

ভুল উত্তর: 2

জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#4 Gemini 3.1 Pro Preview

medium

খরচ: $0.115
সময়: 87.2s
টোকেন: 9,629 tok

রান ইতিহাস

পরীক্ষিত হয়েছে	স্কোর	নির্ভরযোগ্যতা	মোট খরচ	তুলনা করুন
2026-06-04 14:04 নতুন টেস্ট যোগ হয়েছে	9.4	10.0	$1.054	তুলনা করুন
2026-05-22 00:30 স্যুইট পরিবর্তিত হয়েছে	9.3	10.0	$1.006	বর্তমান রান
2026-04-11 01:44 প্রথম নথিভুক্ত রান	9.6	প্রযোজ্য নয়	$0.578	তুলনা করুন

এই রানটি ভিন্ন একটি বেঞ্চমার্ক স্যুইট ব্যবহার করেছে। ঐতিহাসিক পরিবর্তন পড়ার সময় স্যুইট পরিবর্তনও মাথায় রাখুন।

চার্ট

প্রথম মডেলটি নির্বাচন করুন, তারপর দ্বিতীয় মডেলে ক্লিক করে পাশাপাশি তুলনা পৃষ্ঠা খুলুন।

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

বিভাগ	স্কোর	ধারাবাহিকতা
অ্যান্টি-এআই কৌশল	10.0	10.0
কোডিং	7.0	9.8
সমন্বিত	9.5	10.0
ডেটা পার্সিং ও নিষ্কাশন	10.0	10.0
ডোমেইন-নির্দিষ্ট	7.7	10.0
Sadharon Buddhimotta	10.0	10.0
নির্দেশনা অনুসরণ	10.0	10.0
ধাঁধা সমাধান	10.0	10.0
টুল কলিং	10.0	10.0
সাধারণ জ্ঞান	10.0	10.0

Gemini 3.1 Pro Preview

Hamster playing table tennis

#4 Gemini 3.1 Pro Preview

চার্ট

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর vs মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

দ্রুত তুলনা

বিভাগভিত্তিক বিশ্লেষণ

তুলনা করা মডেল