स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: मेट्रिक ↑.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #154 | Qwen3.6 Max Preview medium | Qwen | 0.0 | 7.0 | $1.132 | 0/0 | 0ms |
| #205 | Claude Sonnet 4.6 medium | Anthropic | 0.0 | 6.4 | $2.126 | 0/0 | 0ms |
| #220 | Claude Opus 4.6 medium | Anthropic | 0.0 | 6.3 | $2.961 | 0/0 | 0ms |
| #228 | GLM 5 Turbo medium | Z.ai | 0.0 | 6.2 | $0.323 | 0/0 | 0ms |
| #237 | Claude Sonnet 4.6 none | Anthropic | 0.0 | 6.0 | $0.661 | 0/0 | 0ms |
| #269 | GLM 5V Turbo medium | Z.ai | 0.0 | 5.5 | $0.457 | 0/0 | 0ms |
| #271 | Claude Opus 4.7 none | Anthropic | 0.0 | 5.4 | $0.505 | 0/0 | 0ms |
| #278 | Hy3 preview medium | Tencent | 0.0 | 5.3 | $0.049 | 0/0 | 0ms |
| #282 | Qwen3.6 Max Preview none | Qwen | 0.0 | 5.3 | $0.228 | 0/0 | 0ms |
| #289 | Mimo V2 PRO medium | Xiaomi | 0.0 | 5.2 | $0.333 | 0/0 | 0ms |
| #290 | MiMo-V2-Flash medium | Xiaomi | 0.0 | 5.1 | $0.043 | 0/0 | 0ms |
| #302 | Grok 4.20 Beta medium | X AI | 0.0 | 4.9 | $0.750 | 0/0 | 0ms |
| #306 | Gemini 3 PRO Preview medium | 0.0 | 4.9 | $0.385 | 0/0 | 0ms | |
| #311 | Mimo V2 Omni medium | Xiaomi | 0.0 | 4.9 | $0.683 | 0/0 | 0ms |
| #312 | Hy3 preview high | Tencent | 0.0 | 4.8 | $0.135 | 0/0 | 0ms |