ترتيب إخفاقات استدعاء أداة غير صالح

اكتشف أي نماذج الذكاء الاصطناعي تواجه استدعاء أداة غير صالح أكثر من غيرها، حتى ترى مخاطر الاعتمادية قبل الاختيار. الترتيب حسب: اختبارات صحيحة ↓.

النماذج المعروضة

إجمالي الإخفاقات

100

النموذج الأكثر تأثرًا

Gemini 3.5 Flash 1

الفئات

ضمن الفئة مجمّع91 ضمن الفئة استدعاء الأدوات9

83/83

الترتيب	النموذج	الشركة	عدد استدعاء أداة غير صالح	النتيجة	إجمالي التكلفة	اختبارات صحيحة	زمن الاستجابة (المتوسط)
#110	Gemma 4 31B medium	Google	1	6.3	$0.163	14/22	75.4s
إجمالي الاختبارات 22 الاختبارات الخاطئة 8 إجمالي التكلفة $0.163 زمن الاستجابة (المتوسط) 75.4s
#24	Muse Spark 1.1 low	Meta	1	8.3	$0.647	13/22	11.5s
إجمالي الاختبارات 22 الاختبارات الخاطئة 9 إجمالي التكلفة $0.647 زمن الاستجابة (المتوسط) 11.5s
#45	DeepSeek V4 Flash high	DeepSeek	1	7.7	$0.042	13/22	49.7s
إجمالي الاختبارات 22 الاختبارات الخاطئة 9 إجمالي التكلفة $0.042 زمن الاستجابة (المتوسط) 49.7s
#51	Nemotron 3 Ultra medium	NVIDIA	1	7.5	$0.774	13/22	32.2s
إجمالي الاختبارات 22 الاختبارات الخاطئة 9 إجمالي التكلفة $0.774 زمن الاستجابة (المتوسط) 32.2s
#55	GPT-5.6 Terra low	OpenAI	1	7.5	$0.519	13/22	5.31s
إجمالي الاختبارات 22 الاختبارات الخاطئة 9 إجمالي التكلفة $0.519 زمن الاستجابة (المتوسط) 5.31s
#58	Qwen3.5-27B medium	Qwen	1	7.4	$1.627	13/22	111.9s
إجمالي الاختبارات 22 الاختبارات الخاطئة 9 إجمالي التكلفة $1.627 زمن الاستجابة (المتوسط) 111.9s
#64	Gemini 3.1 Flash Lite Preview medium	Google	1	7.3	$0.115	13/22	4.61s
إجمالي الاختبارات 22 الاختبارات الخاطئة 9 إجمالي التكلفة $0.115 زمن الاستجابة (المتوسط) 4.61s
#65	Gemini 3.1 Flash Lite medium	Google	1	7.3	$0.117	13/22	4.27s
إجمالي الاختبارات 22 الاختبارات الخاطئة 9 إجمالي التكلفة $0.117 زمن الاستجابة (المتوسط) 4.27s
#90	Qwen3.6 35B A3B medium	Qwen	1	6.7	$0.746	13/22	58.1s
إجمالي الاختبارات 22 الاختبارات الخاطئة 9 إجمالي التكلفة $0.746 زمن الاستجابة (المتوسط) 58.1s
#104	Gemini 3.1 Flash Lite Preview low	Google	1	6.5	$0.646	13/22	16.7s
إجمالي الاختبارات 22 الاختبارات الخاطئة 9 إجمالي التكلفة $0.646 زمن الاستجابة (المتوسط) 16.7s
#27	Muse Spark 1.1 high	Meta	2	8.1	$1.694	12/22	31.5s
إجمالي الاختبارات 22 الاختبارات الخاطئة 10 إجمالي التكلفة $1.694 زمن الاستجابة (المتوسط) 31.5s
#56	GPT-5.4 Mini medium	OpenAI	1	7.5	$0.756	12/22	25.9s
إجمالي الاختبارات 22 الاختبارات الخاطئة 10 إجمالي التكلفة $0.756 زمن الاستجابة (المتوسط) 25.9s
#67	Step 3.7 Flash low	Stepfun	1	7.3	$0.454	12/22	20.7s
إجمالي الاختبارات 22 الاختبارات الخاطئة 10 إجمالي التكلفة $0.454 زمن الاستجابة (المتوسط) 20.7s
#68	Kimi K2.6 medium	Moonshot AI	1	7.2	$1.036	12/22	110.0s
إجمالي الاختبارات 22 الاختبارات الخاطئة 10 إجمالي التكلفة $1.036 زمن الاستجابة (المتوسط) 110.0s
#75	Grok 4.20 medium	X AI	1	7.1	$0.777	12/22	29.5s
إجمالي الاختبارات 22 الاختبارات الخاطئة 10 إجمالي التكلفة $0.777 زمن الاستجابة (المتوسط) 29.5s

←

1 2 3 4 5 6

→

إخفاقات استدعاء أداة غير صالح

تصفية النماذج

أفضل النماذج حسب عدد استدعاء أداة غير صالح

عدد استدعاء أداة غير صالح مقابل النتيجة

أفضل النماذج حسب زمن الاستجابة (المتوسط)