غیر معتبر ٹول کال ناکامیاں
دیکھیں کہ کن AI ماڈلز میں غیر معتبر ٹول کال سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: درست ٹیسٹس ↓.
131/131
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غیر معتبر ٹول کال کی تعداد | اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #7 | Gemini 3.5 Flash high | 1 | 9.4 | $2.011 | 19/22 | 15.5s | |
| #17 | Gemini 3.8 Flash medium | 1 | 9.1 | $0.653 | 19/22 | 14.5s | |
| #28 | Gemini 3.5 Flash low | 1 | 8.8 | $0.449 | 18/22 | 5.76s | |
| #19 | Qwen3.7 Max medium | Qwen | 1 | 9.1 | $1.157 | 17/22 | 44.3s |
| #23 | Qwen3.8 Max medium | Qwen | 1 | 9.0 | $0.771 | 17/22 | 23.3s |
| #29 | Muse Spark 1.3 medium | Meta | 1 | 8.8 | $1.469 | 17/22 | 38.6s |
| #39 | Claude Fable 5 medium | Anthropic | 1 | 8.6 | $3.004 | 17/22 | 15.0s |
| #34 | GLM 5.3 Flash max | Z.ai | 1 | 8.7 | $0.059 | 16/22 | 52.1s |
| #38 | Muse Spark 1.1 medium | Meta | 1 | 8.6 | $1.420 | 15/22 | 26.2s |
| #54 | Muse Spark 1.3 low | Meta | 1 | 8.2 | $0.689 | 15/22 | 16.0s |
| #55 | Claude Sonnet 5 medium | Anthropic | 1 | 8.2 | $0.922 | 15/22 | 12.5s |
| #56 | Qwen3.8 2.4T A95B low | Qwen | 1 | 8.1 | $2.672 | 15/22 | 119.0s |
| #59 | Inkling high | Thinkingmachines | 2 | 8.0 | $1.046 | 15/22 | 62.6s |
| #64 | Inkling medium | Thinkingmachines | 1 | 8.0 | $0.383 | 15/22 | 15.7s |
| #70 | Qwen3.7 Plus medium | Qwen | 1 | 7.9 | $0.277 | 15/22 | 53.5s |