غیر معتبر ٹول کال ناکامیاں
دیکھیں کہ کن AI ماڈلز میں غیر معتبر ٹول کال سب سے زیادہ ہوتا ہے، تاکہ آپ انتخاب سے پہلے قابلِ اعتماد ہونے کے خطرات سمجھ سکیں۔ ترتیب دیں حسب: اسکور ↑.
83/83
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غیر معتبر ٹول کال کی تعداد | اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #171 | North Mini Code none | Cohere | 2 | 5.1 | $0.000 | 4/22 | 29.9s |
| #169 | Qwen3.5-9B none | Qwen | 2 | 5.1 | $0.021 | 4/22 | 19.2s |
| #164 | Inkling none | Thinkingmachines | 1 | 5.2 | $0.147 | 6/22 | 3.50s |
| #162 | Ling-2.6-1T none | Inclusionai | 1 | 5.3 | $0.016 | 4/22 | 8.58s |
| #160 | Laguna XS 2.1 none | Poolside | 1 | 5.3 | $0.008 | 5/22 | 1.55s |
| #159 | GPT-5.6 Luna none | OpenAI | 1 | 5.4 | $0.142 | 6/22 | 1.50s |
| #156 | Gemma 4 26B A4B none | 1 | 5.5 | $0.015 | 8/22 | 7.64s | |
| #152 | Qwen3.6 27B none | Qwen | 2 | 5.5 | $0.087 | 7/22 | 10.7s |
| #151 | GLM 5.1 none | Z.ai | 1 | 5.5 | $0.164 | 7/22 | 6.70s |
| #150 | DeepSeek V4 Flash none | DeepSeek | 2 | 5.6 | $0.044 | 5/22 | 36.8s |
| #142 | Qwen3.5-122B-A10B none | Qwen | 1 | 5.7 | $0.247 | 6/22 | 12.9s |
| #137 | North Mini Code medium | Cohere | 1 | 5.9 | $0.000 | 9/22 | 137.1s |
| #132 | GPT-5.6 Terra none | OpenAI | 1 | 6.0 | $0.349 | 8/22 | 1.65s |
| #127 | Qwen3.5-35B-A3B none | Qwen | 1 | 6.1 | $0.106 | 7/22 | 12.7s |
| #125 | Qwen3.5-Flash none | Qwen | 1 | 6.1 | $0.073 | 8/22 | 25.3s |