غیر معتبر ٹول کال ناکامیاں
دیکھیں کہ کن AI ماڈلز میں غیر معتبر ٹول کال سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔
131/131
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غیر معتبر ٹول کال کی تعداد | اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #70 | Qwen3.7 Plus medium | Qwen | 1 | 7.9 | $0.277 | 15/22 | 53.5s |
| #72 | Gemini 3.5 Flash Lite medium | 1 | 7.8 | $0.272 | 14/22 | 5.12s | |
| #76 | Qwen3.8 27B medium | Qwen | 1 | 7.8 | ~$0.058 | 14/22 | 33.0s |
| #79 | Qwen3.7 Flash high | Qwen | 1 | 7.8 | $0.052 | 13/22 | 41.4s |
| #84 | DeepSeek V4 Flash 0423 high | DeepSeek | 1 | 7.6 | $0.039 | 13/22 | 51.8s |
| #88 | Nemotron 3 Ultra medium | NVIDIA | 1 | 7.6 | $0.567 | 13/22 | 33.6s |
| #89 | Claude Opus 5 none | Anthropic | 1 | 7.5 | $1.550 | 12/22 | 7.65s |
| #91 | GPT-5.6 Terra low | OpenAI | 1 | 7.5 | $0.420 | 13/22 | 5.45s |
| #94 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 1 | 7.5 | $0.459 | 14/22 | 91.8s |
| #95 | Qwen3.5-27B medium | Qwen | 1 | 7.5 | $0.982 | 13/22 | 113.3s |
| #97 | GPT-5.4 Mini medium | OpenAI | 1 | 7.5 | $0.786 | 12/22 | 26.7s |
| #100 | Gemini 3.1 Flash Lite Preview medium | 1 | 7.4 | $0.117 | 14/22 | 4.59s | |
| #105 | Qwen3.8 2.4T A95B high | Qwen | 1 | 7.4 | $2.357 | 14/22 | 120.6s |
| #111 | GLM 5.3 Flash high | Z.ai | 1 | 7.3 | $0.029 | 13/22 | 25.4s |
| #112 | Gemini 3.1 Flash Lite medium | 1 | 7.3 | $0.120 | 13/22 | 4.38s |