टूल कॉलिंग रैंकिंग
देखें कि टूल कॉलिंग में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↑.
216/216
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | टूल कॉलिंग स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #132 | Qwen3.5 Plus 2026-04-20 none | Qwen | 10.0 | 6.1 | $0.122 | 1/1 | 4.42s |
| #123 | GPT-5.6 Luna low | OpenAI | 10.0 | 6.2 | $0.249 | 1/1 | 4.43s |
| #144 | Kimi K2.6 none | Moonshot AI | 10.0 | 5.8 | $0.184 | 1/1 | 4.46s |
| #164 | KAT-Coder-Air V2.5 low | Kwaipilot | 10.0 | 5.4 | $0.041 | 1/1 | 4.47s |
| #36 | Inkling medium | Thinkingmachines | 3.0 | 8.0 | $0.391 | 0/1 | 4.48s |
| #69 | Gemini 3.1 Flash Lite medium | 10.0 | 7.3 | $0.117 | 1/1 | 4.55s | |
| #76 | Qwen3.5-122B-A10B medium | Qwen | 10.0 | 7.1 | $1.046 | 1/1 | 4.60s |
| #203 | Grok 4.20 none | X AI | 10.0 | 4.1 | $0.057 | 1/1 | 4.63s |
| #125 | Qwen3.5-35B-A3B medium | Qwen | 10.0 | 6.2 | $0.837 | 1/1 | 4.65s |
| #34 | GPT-5.2 Chat none | OpenAI | 10.0 | 8.0 | $0.604 | 1/1 | 4.68s |
| #99 | Claude Opus 4.7 none | Anthropic | 10.0 | 6.6 | $0.505 | 1/1 | 4.74s |
| #155 | KAT-Coder-Air V2.5 medium | Kwaipilot | 10.0 | 5.6 | $0.048 | 1/1 | 4.77s |
| #150 | KAT-Coder-Air V2.5 high | Kwaipilot | 10.0 | 5.6 | $0.077 | 1/1 | 4.77s |
| #6 | Gemini 3.6 Flash low | 10.0 | 9.4 | $0.517 | 1/1 | 4.78s | |
| #197 | Grok 4.20 Beta none | X AI | 10.0 | 4.4 | $0.087 | 1/1 | 4.79s |