स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↑.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #324 | Laguna S 2.1 low | Poolside | 2.8 | 4.6 | $0.109 | 0/1 | 152.1s |
| #346 | Qwen3.5-9B medium | Qwen | 5.2 | 4.0 | $0.106 | 0/1 | 152.9s |
| #221 | Space Bunny Alpha medium | Stealth | 6.1 | 6.3 | $0.000 | 0/1 | 153.1s |
| #127 | Grok 4.7 low | X AI | 5.0 | 7.4 | $2.263 | 0/1 | 154.9s |
| #368 | Command A+ high | Cohere | 3.9 | 3.2 | $0.079 | 0/1 | 156.0s |
| #305 | Laguna S 2.1 high | Poolside | 2.8 | 4.9 | $0.147 | 0/1 | 158.2s |
| #226 | Space Bunny Alpha xhigh | Stealth | 5.2 | 6.2 | $0.000 | 0/1 | 159.1s |
| #62 | Grok 4.6 high | X AI | 5.0 | 8.5 | $2.629 | 0/1 | 160.9s |
| #211 | Dots 3 Note Preview low | Dots Studio | 6.1 | 6.4 | $0.000 | 0/1 | 161.2s |
| #55 | MiMo-V2.6-Pro medium | Xiaomi | 10.0 | 8.7 | $0.586 | 1/1 | 161.4s |
| #296 | Laguna S 2.1 medium | Poolside | 3.4 | 5.0 | $0.080 | 0/1 | 165.0s |
| #276 | Step 3.5 Flash medium | Stepfun | 2.8 | 5.4 | $0.105 | 0/1 | 172.2s |
| #144 | LongCat 2.0 medium | Meituan | 6.1 | 7.2 | $0.593 | 0/1 | 174.1s |
| #229 | DeepSeek V4 Flash 0731 none | DeepSeek | 10.0 | 6.2 | $0.055 | 1/1 | 174.9s |
| #265 | Kimi K2.6 none | Moonshot AI | 4.7 | 5.5 | $0.376 | 0/1 | 175.2s |