स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: कुल लागत ↑.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #106 | Step 3.7 Flash medium | Stepfun | 7.4 | 7.8 | $0.571 | 0/1 | 93.9s |
| #74 | DeepSeek V4 Flash 0731 high | DeepSeek | 10.0 | 8.4 | $0.578 | 1/1 | 204.4s |
| #56 | MiMo-V2.6-Pro medium | Xiaomi | 10.0 | 8.7 | $0.586 | 1/1 | 161.4s |
| #145 | LongCat 2.0 medium | Meituan | 6.1 | 7.2 | $0.593 | 0/1 | 174.1s |
| #153 | GPT-5.2 Chat none | OpenAI | 3.0 | 7.0 | $0.594 | 0/1 | 955ms |
| #205 | Kimi K2.5 medium | Moonshot AI | 3.9 | 6.4 | $0.603 | 0/1 | 566.8s |
| #43 | Gemini 3.6 Flash low | 10.0 | 9.0 | $0.607 | 1/1 | 48.5s | |
| #13 | GPT-5.6 Sol low | OpenAI | 10.0 | 9.6 | $0.609 | 1/1 | 57.1s |
| #105 | GLM 5.3 high | Z.ai | 10.0 | 7.8 | $0.610 | 1/1 | 40.7s |
| #97 | GLM 5.3 FlashX max | Z.ai | 6.1 | 7.9 | $0.623 | 0/1 | 104.8s |
| #41 | Gemini 3.5 Flash Lite high | 10.0 | 9.0 | $0.624 | 1/1 | 53.1s | |
| #112 | Muse Glimmer 30B high | Meta | 10.0 | 7.7 | $0.625 | 1/1 | 139.7s |
| #135 | Gemini 2.5 Flash medium | 3.0 | 7.3 | $0.644 | 0/1 | 6.54s | |
| #95 | GPT-5.6 Terra low | OpenAI | 10.0 | 7.9 | $0.645 | 1/1 | 54.6s |
| #253 | Trinity Large Thinking high | Arcee AI | 10.0 | 5.7 | $0.645 | 1/1 | 45.0s |