संयुक्त x अमान्य टूल कॉल रैंकिंग

देखें कि संयुक्त में किन AI मॉडलों में अमान्य टूल कॉल आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें। क्रमबद्ध करें: विफलता संख्या ↑.

दिखाए गए मॉडल

कुल विफलताएँ

सबसे अधिक प्रभावित मॉडल

Gemini 3.5 Flash 1

विफलता के कारण

अमान्य टूल कॉल91 गलत उत्तर68 कोई उत्तर नहीं29 API त्रुटि26 समय समाप्त5 अतिरिक्त फॉर्मेटिंग1 निर्देशों का पालन नहीं किया1

श्रेणियाँ

संयुक्त91 टूल कॉलिंग9

77/77

रैंक	मॉडल	कंपनी	अमान्य टूल कॉल संख्या	श्रेणी स्कोर	कुल लागत	सही परीक्षण	प्रतिक्रिया समय (औसत)
#2	Gemini 3.5 Flash high	Google	1	8.2	$1.976	1/2	84.1s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $1.976 प्रतिक्रिया समय (औसत) 84.1s
#8	Qwen3.7 Max medium	Qwen	1	8.7	$1.116	1/2	287.8s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $1.116 प्रतिक्रिया समय (औसत) 287.8s
#11	Gemini 3.5 Flash low	Google	1	8.2	$0.433	1/2	30.0s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $0.433 प्रतिक्रिया समय (औसत) 30.0s
#16	Muse Spark 1.1 medium	Meta	1	8.3	$1.357	1/2	42.6s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $1.357 प्रतिक्रिया समय (औसत) 42.6s
#17	Claude Fable 5 medium	Anthropic	1	6.5	$3.478	1/2	27.5s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $3.478 प्रतिक्रिया समय (औसत) 27.5s
#23	Claude Sonnet 5 medium	Anthropic	1	7.3	$0.922	1/2	51.9s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $0.922 प्रतिक्रिया समय (औसत) 51.9s
#24	Muse Spark 1.1 low	Meta	1	6.6	$0.647	1/2	29.4s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $0.647 प्रतिक्रिया समय (औसत) 29.4s
#28	Inkling high	Thinkingmachines	1	7.3	$1.006	1/2	63.8s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $1.006 प्रतिक्रिया समय (औसत) 63.8s
#29	Step 3.7 Flash medium	Stepfun	1	7.3	$0.515	1/2	80.9s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $0.515 प्रतिक्रिया समय (औसत) 80.9s
#34	GPT-5.6 Terra high	OpenAI	1	8.7	$1.055	1/2	13.7s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $1.055 प्रतिक्रिया समय (औसत) 13.7s
#36	Qwen3.7 Plus medium	Qwen	1	8.2	$0.267	1/2	190.3s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $0.267 प्रतिक्रिया समय (औसत) 190.3s
#45	DeepSeek V4 Flash high	DeepSeek	1	6.4	$0.042	1/2	104.1s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $0.042 प्रतिक्रिया समय (औसत) 104.1s
#51	Nemotron 3 Ultra medium	NVIDIA	1	6.3	$0.774	1/2	218.2s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $0.774 प्रतिक्रिया समय (औसत) 218.2s
#55	GPT-5.6 Terra low	OpenAI	1	8.7	$0.519	1/2	9.68s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $0.519 प्रतिक्रिया समय (औसत) 9.68s
#56	GPT-5.4 Mini medium	OpenAI	1	6.9	$0.756	1/2	59.6s
कुल टेस्ट 2 गलत टेस्ट 1 कुल लागत $0.756 प्रतिक्रिया समय (औसत) 59.6s

1 2 3 4 5 6

→

मॉडल फ़िल्टर करें

अमान्य टूल कॉल संख्या के अनुसार शीर्ष मॉडल

अमान्य टूल कॉल संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल

अनुमानित व्यर्थ लागत के अनुसार शीर्ष मॉडल

संयुक्त: अमान्य टूल कॉल

मॉडल फ़िल्टर करें

अमान्य टूल कॉल संख्या के अनुसार शीर्ष मॉडल

अमान्य टूल कॉल संख्या बनाम स्कोर

प्रतिक्रिया समय (औसत) के अनुसार शीर्ष मॉडल

अनुमानित व्यर्थ लागत के अनुसार शीर्ष मॉडल