स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं।
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #313 | GLM 4.7 Flash none | Z.ai | 5.0 | 4.8 | $0.027 | 0/1 | 80.7s |
| #318 | Granite 4.2 8B high | IBM Granite | 5.0 | 4.7 | $0.161 | 0/1 | 223.5s |
| #319 | Qwen3 Coder Next medium | Qwen | 5.0 | 4.7 | $0.069 | 0/1 | 151.4s |
| #336 | Granite 4.2 8B none | IBM Granite | 5.0 | 4.4 | $0.047 | 0/1 | 49.2s |
| #344 | Mercury 2.5 none | Inception | 5.0 | 4.1 | $0.026 | 0/1 | 63.4s |
| #363 | Command A+ medium | Cohere | 5.0 | 3.4 | $0.064 | 0/1 | 112.8s |
| #137 | Qwen3.6 Plus medium | Qwen | 4.7 | 7.3 | $0.391 | 0/1 | 307.1s |
| #138 | Gemini 3.5 Flash Lite medium | 4.7 | 7.3 | $0.440 | 0/1 | 86.9s | |
| #143 | Claude Opus 4.8 low | Anthropic | 4.7 | 7.2 | $3.787 | 0/1 | 110.7s |
| #146 | GLM 5 medium | Z.ai | 4.7 | 7.2 | $0.360 | 0/1 | 110.7s |
| #157 | Ember-1 low | Fireworks | 4.7 | 7.0 | $1.488 | 0/1 | 121.3s |
| #203 | Solar Pro 4 medium | Upstage | 4.7 | 6.4 | $0.174 | 0/1 | 272.3s |
| #206 | Mercury 2.5 medium | Inception | 4.7 | 6.4 | $0.034 | 0/1 | 107.9s |
| #238 | GLM 5.3 FlashX low | Z.ai | 4.7 | 6.0 | $0.157 | 0/1 | 78.0s |
| #246 | Claude Sonnet 5 none | Anthropic | 4.7 | 5.9 | $1.095 | 0/1 | 64.7s |