غیر معتبر ٹول کال ناکامیاں
دیکھیں کہ کن AI ماڈلز میں غیر معتبر ٹول کال سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: کل لاگت ↓.
83/83
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غیر معتبر ٹول کال کی تعداد | اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #17 | Claude Fable 5 medium | Anthropic | 1 | 8.6 | $3.478 | 17/22 | 17.2s |
| #2 | Gemini 3.5 Flash high | 1 | 9.5 | $1.976 | 20/22 | 15.1s | |
| #27 | Muse Spark 1.1 high | Meta | 2 | 8.1 | $1.694 | 12/22 | 31.5s |
| #58 | Qwen3.5-27B medium | Qwen | 1 | 7.4 | $1.627 | 13/22 | 111.9s |
| #16 | Muse Spark 1.1 medium | Meta | 1 | 8.6 | $1.357 | 15/22 | 25.0s |
| #86 | Step 3.7 Flash high | Stepfun | 1 | 6.9 | $1.207 | 11/22 | 64.7s |
| #8 | Qwen3.7 Max medium | Qwen | 1 | 9.2 | $1.116 | 18/22 | 40.6s |
| #34 | GPT-5.6 Terra high | OpenAI | 1 | 8.0 | $1.055 | 14/22 | 11.3s |
| #72 | Qwen3.5-122B-A10B medium | Qwen | 1 | 7.1 | $1.046 | 14/22 | 64.2s |
| #68 | Kimi K2.6 medium | Moonshot AI | 1 | 7.2 | $1.036 | 12/22 | 110.0s |
| #28 | Inkling high | Thinkingmachines | 2 | 8.0 | $1.006 | 15/22 | 64.2s |
| #23 | Claude Sonnet 5 medium | Anthropic | 1 | 8.3 | $0.922 | 16/22 | 12.5s |
| #119 | Qwen3.5-35B-A3B medium | Qwen | 1 | 6.2 | $0.837 | 11/22 | 112.5s |
| #99 | Qwen3.6 27B medium | Qwen | 2 | 6.5 | $0.779 | 10/22 | 106.3s |
| #75 | Grok 4.20 medium | X AI | 1 | 7.1 | $0.777 | 12/22 | 29.5s |