مشترکہ: غیر معتبر ٹول کال
مشترکہ
غیر معتبر ٹول کال
دیکھیں کہ مشترکہ میں کن AI ماڈلز کو غیر معتبر ٹول کال پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔
ناکامی کی وجوہات
زمرے
125/125
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غیر معتبر ٹول کال کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #84 | DeepSeek V4 Flash 0423 high | DeepSeek | 1 | 6.4 | $0.039 | 1/2 | 104.1s |
| #88 | Nemotron 3 Ultra medium | NVIDIA | 1 | 6.3 | $0.567 | 1/2 | 218.2s |
| #89 | Claude Opus 5 none | Anthropic | 1 | 8.3 | $1.550 | 1/2 | 30.5s |
| #91 | GPT-5.6 Terra low | OpenAI | 1 | 8.7 | $0.420 | 1/2 | 9.68s |
| #94 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 1 | 6.9 | $0.459 | 1/2 | 175.8s |
| #95 | Qwen3.5-27B medium | Qwen | 1 | 7.3 | $0.982 | 1/2 | 595.2s |
| #97 | GPT-5.4 Mini medium | OpenAI | 1 | 6.9 | $0.786 | 1/2 | 59.6s |
| #100 | Gemini 3.1 Flash Lite Preview medium | 1 | 7.2 | $0.117 | 1/2 | 16.6s | |
| #105 | Qwen3.8 2.4T A95B high | Qwen | 1 | 6.9 | $2.357 | 1/2 | 266.1s |
| #111 | GLM 5.3 Flash high | Z.ai | 1 | 6.4 | $0.029 | 1/2 | 91.1s |
| #112 | Gemini 3.1 Flash Lite medium | 1 | 7.2 | $0.120 | 1/2 | 18.5s | |
| #114 | DeepSeek V4 Flash 0731 medium | DeepSeek | 1 | 7.3 | $0.066 | 1/2 | 150.6s |
| #116 | Kimi K2.6 medium | Moonshot AI | 1 | 6.9 | $1.247 | 1/2 | 458.6s |
| #117 | KAT-Coder-Pro V2.5 high | Kwaipilot | 1 | 7.3 | $0.506 | 1/2 | 106.7s |
| #122 | Qwen3.5-122B-A10B medium | Qwen | 1 | 6.4 | $1.207 | 1/2 | 313.5s |