غیر معتبر ٹول کال ناکامیاں
دیکھیں کہ کن AI ماڈلز میں غیر معتبر ٹول کال سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: کل لاگت ↑.
131/131
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غیر معتبر ٹول کال کی تعداد | اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #154 | GLM 5V Turbo medium | Z.ai | 2 | 6.7 | $0.457 | 11/21 | 23.1s |
| #94 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 1 | 7.5 | $0.459 | 14/22 | 91.8s |
| #134 | Kimi K2.5 medium | Moonshot AI | 1 | 7.0 | $0.479 | 10/22 | 98.2s |
| #151 | KAT-Coder-Pro V2.5 none | Kwaipilot | 1 | 6.7 | $0.487 | 11/22 | 26.0s |
| #68 | Step 3.7 Flash medium | Stepfun | 1 | 7.9 | $0.495 | 13/22 | 23.5s |
| #117 | KAT-Coder-Pro V2.5 high | Kwaipilot | 1 | 7.2 | $0.506 | 11/22 | 22.1s |
| #58 | Muse Glimmer 30B xhigh | Meta | 1 | 8.1 | $0.510 | 13/22 | 95.6s |
| #88 | Nemotron 3 Ultra medium | NVIDIA | 1 | 7.6 | $0.567 | 13/22 | 33.6s |
| #272 | Trinity Large Thinking high | Arcee AI | 2 | 4.8 | $0.592 | 5/22 | 75.9s |
| #161 | Gemini 3.1 Flash Lite low | 1 | 6.6 | $0.621 | 13/22 | 16.2s | |
| #194 | Trinity Large Thinking low | Arcee AI | 2 | 6.0 | $0.625 | 8/22 | 96.6s |
| #159 | Gemini 3.1 Flash Lite Preview low | 1 | 6.6 | $0.646 | 14/22 | 16.7s | |
| #17 | Gemini 3.8 Flash medium | 1 | 9.1 | $0.653 | 19/22 | 14.5s | |
| #162 | Qwen3.6 35B A3B medium | Qwen | 1 | 6.6 | $0.672 | 12/22 | 58.5s |
| #51 | Muse Spark 1.1 low | Meta | 1 | 8.3 | $0.673 | 13/22 | 11.9s |