टूल कॉलिंग: गलत उत्तर
टूल कॉलिंग
गलत उत्तर
देखें कि टूल कॉलिंग में किन AI मॉडलों में गलत उत्तर आने की सबसे अधिक संभावना है, ताकि आप कमजोरियाँ जल्दी पहचान सकें।
विफलता के कारण
5/5
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | गलत उत्तर संख्या | श्रेणी स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #69 | Qwen3.8 27B low | Qwen | 1 | 3.0 | ~$0.071 | 0/1 | 8.42s |
| #91 | GPT-5.6 Terra low | OpenAI | 1 | 4.7 | $0.420 | 0/1 | 6.69s |
| #275 | GLM 4.7 Flash none | Z.ai | 1 | 2.8 | $0.016 | 0/1 | 7.05s |
| #285 | Laguna S 2.1 none | Poolside | 1 | 4.7 | $0.022 | 0/1 | 1.45s |
| #303 | Grok 4.1 Fast none | X AI | 1 | 2.8 | $0.008 | 0/1 | 5.51s |