अमान्य टूल कॉल विफलताएँ
देखें कि किन AI मॉडलों में अमान्य टूल कॉल सबसे अधिक होता है, ताकि आप चुनने से पहले भरोसेमंदी के जोखिम समझ सकें। क्रमबद्ध करें: कुल लागत ↑.
श्रेणियाँ
131/131
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | अमान्य टूल कॉल संख्या | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #54 | Muse Spark 1.3 low | Meta | 1 | 8.2 | $0.689 | 15/22 | 16.0s |
| #140 | Qwen3.6 Flash medium | Qwen | 1 | 6.8 | $0.741 | 12/22 | 45.0s |
| #189 | Trinity Large Thinking medium | Arcee AI | 2 | 6.1 | $0.756 | 8/22 | 85.4s |
| #23 | Qwen3.8 Max medium | Qwen | 1 | 9.0 | $0.771 | 17/22 | 23.3s |
| #97 | GPT-5.4 Mini medium | OpenAI | 1 | 7.5 | $0.786 | 12/22 | 26.7s |
| #132 | Grok 4.20 medium | X AI | 1 | 7.0 | $0.805 | 11/22 | 32.6s |
| #65 | GPT-5.6 Terra high | OpenAI | 1 | 8.0 | $0.836 | 14/22 | 11.2s |
| #55 | Claude Sonnet 5 medium | Anthropic | 1 | 8.2 | $0.922 | 15/22 | 12.5s |
| #95 | Qwen3.5-27B medium | Qwen | 1 | 7.5 | $0.982 | 13/22 | 113.3s |
| #165 | Qwen3.6 27B medium | Qwen | 2 | 6.5 | $1.045 | 10/22 | 106.1s |
| #59 | Inkling high | Thinkingmachines | 2 | 8.0 | $1.046 | 15/22 | 62.6s |
| #183 | Qwen3.5-35B-A3B medium | Qwen | 1 | 6.1 | $1.140 | 11/22 | 110.8s |
| #19 | Qwen3.7 Max medium | Qwen | 1 | 9.1 | $1.157 | 17/22 | 44.3s |
| #122 | Qwen3.5-122B-A10B medium | Qwen | 1 | 7.1 | $1.207 | 14/22 | 65.7s |
| #141 | Step 3.7 Flash high | Stepfun | 1 | 6.8 | $1.229 | 11/22 | 70.1s |