स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↑.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #132 | GLM 5.3 Flash high | Z.ai | 7.4 | 7.3 | $0.084 | 0/1 | 111.5s |
| #133 | Claude Fable 5.1 medium | Anthropic | 3.0 | 7.3 | $3.197 | 0/1 | 16.2s |
| #134 | Grok 4.7 medium | X AI | 3.9 | 7.3 | $3.501 | 0/1 | 372.1s |
| #135 | Gemini 2.5 Flash medium | 3.0 | 7.3 | $0.644 | 0/1 | 6.54s | |
| #137 | Qwen3.6 Plus medium | Qwen | 4.7 | 7.3 | $0.391 | 0/1 | 307.1s |
| #138 | Gemini 3.5 Flash Lite medium | 4.7 | 7.3 | $0.440 | 0/1 | 86.9s | |
| #140 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 6.1 | 7.2 | $0.567 | 0/1 | 186.4s |
| #141 | Qwen3.8 27B medium | Qwen | 4.7 | 7.2 | ~$0.073 | 0/1 | 187.9s |
| #142 | Claude Opus 4.8 low | Anthropic | 4.7 | 7.2 | $3.787 | 0/1 | 110.7s |
| #143 | Qwen3.7 Flash high | Qwen | 4.7 | 7.2 | $0.063 | 0/1 | 135.9s |
| #144 | LongCat 2.0 medium | Meituan | 6.1 | 7.2 | $0.593 | 0/1 | 174.1s |
| #145 | GLM 5 medium | Z.ai | 4.7 | 7.2 | $0.360 | 0/1 | 110.7s |
| #146 | Step 3.7 Flash low | Stepfun | 7.4 | 7.2 | $0.449 | 0/1 | 83.6s |
| #147 | Gemini 3.8 Flash low | 5.9 | 7.2 | $0.334 | 0/1 | 62.9s | |
| #149 | Claude Opus 5 none | Anthropic | 5.4 | 7.1 | $2.766 | 0/1 | 79.6s |