خودمختار ایجنٹ کے کام: غیر معتبر ٹول کال
خودمختار ایجنٹ کے کام
غیر معتبر ٹول کال
دیکھیں کہ خودمختار ایجنٹ کے کام میں کن AI ماڈلز کو غیر معتبر ٹول کال پیش آنے کا سب سے زیادہ امکان ہے، تاکہ آپ کمزوریاں جلدی پہچان سکیں۔ ترتیب دیں حسب: کل لاگت ↓.
ناکامی کی وجوہات
44/44
ماڈلز فلٹر کریں
موجودہ تلاش اور فلٹرز سے کوئی ماڈل مطابقت نہیں رکھتا۔
| درجہ | ماڈل | کمپنی | غیر معتبر ٹول کال کی تعداد | زمرہ اسکور | کل لاگت | درست ٹیسٹس | ردِعمل کا وقت (اوسط) |
|---|---|---|---|---|---|---|---|
| #175 | Grok 4.7 xhigh | X AI | 1 | 3.0 | $4.054 | 0/1 | 304.8s |
| #87 | Claude Opus 4.7 medium | Anthropic | 1 | 5.2 | $3.636 | 0/1 | 150.6s |
| #179 | Grok 4.7 high | X AI | 1 | 3.0 | $3.582 | 0/1 | 322.2s |
| #46 | Claude Opus 5 medium | Anthropic | 1 | 7.4 | $2.896 | 0/1 | 87.6s |
| #67 | Gemini 3.5 Flash high | 1 | 4.1 | $2.672 | 0/1 | 84.7s | |
| #164 | Ember-1 high | Fireworks | 1 | 6.1 | $2.405 | 0/1 | 88.3s |
| #225 | Gemini 3.5 Flash none | 1 | 3.5 | $1.778 | 0/1 | 89.3s | |
| #157 | Ember-1 low | Fireworks | 1 | 4.7 | $1.488 | 0/1 | 121.3s |
| #176 | Grok Build 0.1 medium | X AI | 1 | 3.4 | $1.419 | 0/1 | 69.0s |
| #89 | Gemini 3.5 Flash medium | 1 | 3.8 | $1.308 | 0/1 | 83.6s | |
| #85 | Claude Sonnet 5.5 high | Anthropic | 1 | 7.4 | $1.197 | 0/1 | 53.6s |
| #158 | Qwen3.5-122B-A10B medium | Qwen | 1 | 6.1 | $1.152 | 0/1 | 95.3s |
| #61 | Qwen3.8 Max (0902) low | Qwen | 1 | 6.1 | $1.131 | 0/1 | 136.0s |
| #199 | Grok 4.3 medium | X AI | 1 | 3.9 | $0.989 | 0/1 | 51.6s |
| #121 | GPT-5.4 Mini medium | OpenAI | 1 | 7.4 | $0.965 | 0/1 | 84.3s |