टूल कॉलिंग रैंकिंग
देखें कि टूल कॉलिंग में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↑.
330/330
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | टूल कॉलिंग स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #111 | Grok Build 0.1 medium | X AI | 10.0 | 7.5 | $1.130 | 1/1 | 13.1s |
| #150 | Claude Fable 5.1 low | Anthropic | 10.0 | 6.9 | $2.565 | 1/1 | 13.2s |
| #51 | GPT-5.4 medium | OpenAI | 10.0 | 8.5 | $1.560 | 1/1 | 13.3s |
| #26 | Claude Fable 5.1 high | Anthropic | 10.0 | 9.0 | $3.364 | 1/1 | 13.3s |
| #17 | Grok 4.6 high | X AI | 10.0 | 9.3 | $1.908 | 1/1 | 13.3s |
| #146 | Grok 4.20 medium | X AI | 3.0 | 7.0 | $0.805 | 0/1 | 13.7s |
| #52 | DeepSeek V4.1 Flash low | DeepSeek | 10.0 | 8.5 | $0.448 | 1/1 | 13.8s |
| #218 | Dots 3 Note Preview medium | Dots Studio | 10.0 | 5.9 | $0.000 | 1/1 | 14.0s |
| #219 | Mimo V2 Omni medium | Xiaomi | 10.0 | 5.9 | $0.683 | 1/1 | 14.0s |
| #254 | Kimi K2.5 none | Moonshot AI | 10.0 | 5.4 | $0.101 | 1/1 | 14.0s |
| #119 | Grok 4.6 low | X AI | 10.0 | 7.4 | $0.449 | 1/1 | 14.4s |
| #132 | Qwen3.5 Plus 2026-04-20 medium | Qwen | 10.0 | 7.2 | $0.323 | 1/1 | 14.7s |
| #83 | Qwen3.7 Plus medium | Qwen | 10.0 | 7.9 | $0.277 | 1/1 | 15.0s |
| #182 | Hy3 preview medium | Tencent | 10.0 | 6.5 | $0.049 | 1/1 | 15.0s |
| #299 | Granite 4.2 8B high | IBM Granite | 10.0 | 4.6 | $0.135 | 1/1 | 15.1s |