টুল কলিং মডেল র‌্যাঙ্কিং | AI BENCHY

AI BENCHY বিভাগ

দেখুন টুল কলিং এ কোন AI মডেল সবচেয়ে ভালো করে, কোনগুলো নির্ভরযোগ্য থাকে, আর সবচেয়ে বড় পার্থক্য কোথায় দেখা যায়। সাজান: মেট্রিক ↑.

দেখানো মডেল

15

গড় টুল কলিং স্কোর

8.7

সেরা মডেল

Grok 4.1 Fast 2.8

ব্যর্থতার কারণ

ব্যর্থতার কারণ API ত্রুটি সহ15 ব্যর্থতার কারণ অবৈধ টুল কল সহ7 ব্যর্থতার কারণ নির্দেশনা অনুসরণ করা হয়নি সহ6 ব্যর্থতার কারণ কোন উত্তর নেই সহ2 ব্যর্থতার কারণ ভুল উত্তর সহ2

র‍্যাঙ্ক	মডেল	কোম্পানি	টুল কলিং স্কোর	স্কোর	সঠিক টেস্ট	প্রতিক্রিয়া সময় (গড়)
#30	Qwen3.5-27B medium	Qwen	10.0	7.8	1/1	7.45s
#31	DeepSeek V4 Flash high	DeepSeek	10.0	7.7	1/1	74.7s
#32	Gemini 3.5 Flash minimal	Google	10.0	7.7	1/1	2.79s
#33	Hy3 preview medium	Tencent	10.0	7.7	1/1	15.0s
#34	Qwen3.7 Max none	Qwen	10.0	7.7	1/1	3.92s
#35	Gemini 3 PRO Preview medium	Google	10.0	7.6	1/1	12.0s
#36	Qwen3.5 Plus 2026-04-20 medium	Qwen	10.0	7.6	1/1	14.7s
#37	Gemma 4 26B A4B medium	Google	10.0	7.6	1/1	9.01s
#38	Grok 4.3 medium	X AI	10.0	7.6	1/1	17.7s
#39	Qwen3.6 Flash medium	Qwen	10.0	7.5	1/1	4.00s
#40	Gemini 3.1 Flash Lite Preview medium	Google	10.0	7.5	1/1	3.80s
#41	Nemotron 3 Ultra 550b A55b medium	NVIDIA	10.0	7.5	1/1	7.72s
#43	MiMo-V2.5-Pro medium	Xiaomi	10.0	7.5	1/1	16.9s
#44	Gemini 3.1 Flash Lite medium	Google	10.0	7.5	1/1	4.55s
#47	Grok Build 0.1 medium	X AI	10.0	7.4	1/1	13.1s

টুল কলিং স্কোর অনুযায়ী শীর্ষ মডেল

টুল কলিং স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়) অনুযায়ী শীর্ষ মডেল