غیر معتبر ٹول کال ناکامیاں
دیکھیں کہ کن AI ماڈلز میں غیر معتبر ٹول کال سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: اسکور ↓.
83/83
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غیر معتبر ٹول کال کی تعداد | اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #152 | Qwen3.6 27B none | Qwen | 2 | 5.5 | $0.087 | 7/22 | 10.7s |
| #156 | Gemma 4 26B A4B none | 1 | 5.5 | $0.015 | 8/22 | 7.64s | |
| #159 | GPT-5.6 Luna none | OpenAI | 1 | 5.4 | $0.142 | 6/22 | 1.50s |
| #160 | Laguna XS 2.1 none | Poolside | 1 | 5.3 | $0.008 | 5/22 | 1.55s |
| #162 | Ling-2.6-1T none | Inclusionai | 1 | 5.3 | $0.016 | 4/22 | 8.58s |
| #164 | Inkling none | Thinkingmachines | 1 | 5.2 | $0.147 | 6/22 | 3.50s |
| #169 | Qwen3.5-9B none | Qwen | 2 | 5.1 | $0.021 | 4/22 | 19.2s |
| #171 | North Mini Code none | Cohere | 2 | 5.1 | $0.000 | 4/22 | 29.9s |
| #172 | MiniMax M2.7 medium | Minimax | 1 | 5.0 | $0.163 | 5/22 | 41.3s |
| #173 | DeepSeek V3.2 none | DeepSeek | 2 | 5.0 | $0.054 | 6/22 | 18.3s |
| #176 | GLM 4.7 Flash none | Z.ai | 2 | 4.9 | $0.016 | 6/22 | 9.15s |
| #178 | Ling-2.6-flash none | Inclusionai | 3 | 4.9 | $0.002 | 6/22 | 10.7s |
| #188 | Cobuddy medium | Baidu | 1 | 4.7 | $0.000 | 7/21 | 39.9s |
| #190 | MiniMax M2.5 medium | Minimax | 1 | 4.6 | $0.340 | 5/22 | 68.3s |
| #191 | Grok 4.20 Beta none | X AI | 1 | 4.4 | $0.087 | 6/18 | 1.19s |