टूल कॉलिंग रैंकिंग
देखें कि टूल कॉलिंग में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↑.
216/216
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | टूल कॉलिंग स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #7 | GPT-5.6 Sol medium | OpenAI | 10.0 | 9.4 | $1.316 | 1/1 | 6.30s |
| #8 | GPT-5.6 Sol high | OpenAI | 10.0 | 9.4 | $1.234 | 1/1 | 7.08s |
| #9 | GPT-5.5 low | OpenAI | 10.0 | 9.3 | $1.253 | 1/1 | 4.96s |
| #10 | Gemini 3.1 Pro Preview medium | 10.0 | 9.2 | $1.361 | 1/1 | 23.1s | |
| #11 | Qwen3.7 Max medium | Qwen | 10.0 | 9.2 | $1.116 | 1/1 | 6.63s |
| #12 | Gemini 3.5 Flash medium | 10.0 | 9.1 | $0.642 | 1/1 | 3.81s | |
| #13 | GPT-5.5 medium | OpenAI | 10.0 | 9.0 | $4.137 | 1/1 | 10.6s |
| #14 | Gemini 3.5 Flash low | 10.0 | 8.9 | $0.433 | 1/1 | 3.27s | |
| #15 | Grok 4.5 high | X AI | 10.0 | 8.9 | $1.707 | 1/1 | 5.71s |
| #16 | GPT-5.3-Codex medium | OpenAI | 10.0 | 8.9 | $0.920 | 1/1 | 6.37s |
| #17 | Claude Opus 4.8 medium | Anthropic | 10.0 | 8.8 | $1.931 | 1/1 | 8.96s |
| #18 | Claude Opus 4.7 medium | Anthropic | 10.0 | 8.7 | $1.477 | 1/1 | 4.17s |
| #19 | Muse Spark 1.1 medium | Meta | 9.8 | 8.6 | $1.357 | 1/1 | 6.99s |
| #20 | Claude Fable 5 medium | Anthropic | 10.0 | 8.6 | $3.478 | 1/1 | 17.0s |
| #21 | GPT-5.4 medium | OpenAI | 10.0 | 8.5 | $1.533 | 1/1 | 13.3s |