स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: कुल लागत ↑.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #129 | DeepSeek V4 Pro 0423 none | DeepSeek | 10.0 | 7.4 | $0.311 | 1/1 | 65.5s |
| #197 | GLM 5.1 none | Z.ai | 10.0 | 6.5 | $0.311 | 1/1 | 107.2s |
| #142 | Gemini 3.8 Flash low | 6.1 | 7.2 | $0.323 | 0/1 | 67.2s | |
| #227 | GLM 5 Turbo medium | Z.ai | 0.0 | 6.2 | $0.323 | 0/0 | 0ms |
| #289 | Mimo V2 PRO medium | Xiaomi | 0.0 | 5.2 | $0.333 | 0/0 | 0ms |
| #115 | Muse Glimmer 30B medium | Meta | 10.0 | 7.7 | $0.353 | 1/1 | 107.4s |
| #340 | MiniMax M2.5 medium | Minimax | 3.0 | 4.3 | $0.359 | 0/1 | 600.8s |
| #146 | GLM 5 medium | Z.ai | 4.7 | 7.2 | $0.360 | 0/1 | 110.7s |
| #59 | DeepSeek V4.1 Flash max | DeepSeek | 10.0 | 8.6 | $0.368 | 1/1 | 66.6s |
| #180 | MiniMax M3 medium | Minimax | 3.0 | 6.7 | $0.372 | 0/1 | 116.5s |
| #265 | Kimi K2.6 none | Moonshot AI | 4.7 | 5.5 | $0.376 | 0/1 | 175.2s |
| #306 | Gemini 3 PRO Preview medium | 0.0 | 4.9 | $0.385 | 0/0 | 0ms | |
| #137 | Qwen3.6 Plus medium | Qwen | 4.7 | 7.3 | $0.391 | 0/1 | 307.1s |
| #83 | GLM 5.2 medium | Z.ai | 10.0 | 8.2 | $0.398 | 1/1 | 102.4s |
| #191 | KAT-Coder-Pro V2.5 low | Kwaipilot | 3.0 | 6.5 | $0.400 | 0/1 | 1.75s |