स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: कुल लागत ↓.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #138 | Gemini 3.5 Flash Lite medium | 4.7 | 7.3 | $0.440 | 0/1 | 86.9s | |
| #17 | Gemini 3.7 Flash medium | 10.0 | 9.5 | $0.432 | 1/1 | 58.4s | |
| #81 | Qwen3.7 Plus medium | Qwen | 10.0 | 8.3 | $0.432 | 1/1 | 196.5s |
| #152 | MiMo-V2.5 medium | Xiaomi | 10.0 | 7.1 | $0.419 | 1/1 | 113.6s |
| #128 | Inkling Small high | Thinkingmachines | 3.0 | 7.4 | $0.402 | 0/1 | 23ms |
| #191 | KAT-Coder-Pro V2.5 low | Kwaipilot | 3.0 | 6.5 | $0.400 | 0/1 | 1.75s |
| #83 | GLM 5.2 medium | Z.ai | 10.0 | 8.2 | $0.398 | 1/1 | 102.4s |
| #137 | Qwen3.6 Plus medium | Qwen | 4.7 | 7.3 | $0.391 | 0/1 | 307.1s |
| #306 | Gemini 3 PRO Preview medium | 0.0 | 4.9 | $0.385 | 0/0 | 0ms | |
| #265 | Kimi K2.6 none | Moonshot AI | 4.7 | 5.5 | $0.376 | 0/1 | 175.2s |
| #180 | MiniMax M3 medium | Minimax | 3.0 | 6.7 | $0.372 | 0/1 | 116.5s |
| #59 | DeepSeek V4.1 Flash max | DeepSeek | 10.0 | 8.6 | $0.368 | 1/1 | 66.6s |
| #146 | GLM 5 medium | Z.ai | 4.7 | 7.2 | $0.360 | 0/1 | 110.7s |
| #340 | MiniMax M2.5 medium | Minimax | 3.0 | 4.3 | $0.359 | 0/1 | 600.8s |
| #115 | Muse Glimmer 30B medium | Meta | 10.0 | 7.7 | $0.353 | 1/1 | 107.4s |