टूल कॉलिंग रैंकिंग
देखें कि टूल कॉलिंग में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: कुल लागत ↓.
330/330
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | टूल कॉलिंग स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #22 | Gemini 3.8 Flash medium | 10.0 | 9.1 | $0.653 | 1/1 | 18.5s | |
| #174 | Gemini 3.1 Flash Lite Preview low | 10.0 | 6.6 | $0.646 | 1/1 | 9.54s | |
| #6 | Gemini 3.7 Flash high | 10.0 | 9.8 | $0.646 | 1/1 | 16.3s | |
| #66 | Gemini 2.5 Flash medium | 10.0 | 8.2 | $0.644 | 1/1 | 6.20s | |
| #209 | Trinity Large Thinking low | Arcee AI | 10.0 | 6.0 | $0.625 | 1/1 | 5.19s |
| #176 | Gemini 3.1 Flash Lite low | 10.0 | 6.6 | $0.621 | 1/1 | 5.66s | |
| #80 | GPT-5.2 Chat none | OpenAI | 10.0 | 7.9 | $0.594 | 1/1 | 4.68s |
| #289 | Trinity Large Thinking high | Arcee AI | 10.0 | 4.8 | $0.592 | 1/1 | 5.96s |
| #180 | Qwen3.6 27B medium | Qwen | 10.0 | 6.5 | $0.577 | 1/1 | 16.9s |
| #53 | DeepSeek V4.1 Flash high | DeepSeek | 10.0 | 8.5 | $0.574 | 1/1 | 15.3s |
| #196 | Claude Sonnet 5 none | Anthropic | 10.0 | 6.1 | $0.548 | 1/1 | 6.80s |
| #317 | Grok Build 0.1 none | X AI | 3.0 | 4.0 | $0.547 | 0/1 | 0ms |
| #144 | GPT-5.5 none | OpenAI | 10.0 | 7.0 | $0.544 | 1/1 | 3.90s |
| #54 | DeepSeek V4.1 Flash medium | DeepSeek | 10.0 | 8.5 | $0.544 | 1/1 | 15.3s |
| #39 | Gemini 3.5 Flash Lite high | 10.0 | 8.8 | $0.540 | 1/1 | 4.55s |