स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: प्रतिक्रिया समय (औसत) ↑.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #86 | Seed-2.0-Code low | Bytedance Seed | 10.0 | 8.1 | $0.881 | 1/1 | 90.2s |
| #173 | Space Bunny Alpha max | Stealth | 6.1 | 6.7 | $0.000 | 0/1 | 90.6s |
| #57 | Seed 2.1 Turbo medium | Bytedance Seed | 10.0 | 8.7 | $2.042 | 1/1 | 90.9s |
| #125 | Seed-2.0-Code medium | Bytedance Seed | 10.0 | 7.4 | $1.275 | 1/1 | 91.7s |
| #223 | DeepSeek V4 Flash 0423 none | DeepSeek | 10.0 | 6.3 | $0.050 | 1/1 | 92.9s |
| #277 | Ember-1 none | Fireworks | 6.1 | 5.4 | $0.786 | 0/1 | 92.9s |
| #245 | Qwen3.6 Flash none | Qwen | 5.0 | 5.9 | $0.143 | 0/1 | 93.5s |
| #106 | Step 3.7 Flash medium | Stepfun | 7.4 | 7.8 | $0.571 | 0/1 | 93.9s |
| #254 | GPT-5 Nano medium | OpenAI | 4.7 | 5.7 | $0.139 | 0/1 | 94.1s |
| #37 | Seed 2.1 Turbo high | Bytedance Seed | 10.0 | 9.1 | $1.892 | 1/1 | 94.8s |
| #158 | Qwen3.5-122B-A10B medium | Qwen | 6.1 | 7.0 | $1.152 | 0/1 | 95.3s |
| #44 | GLM 5.3 Flash max | Z.ai | 10.0 | 9.0 | $0.147 | 1/1 | 96.7s |
| #49 | Qwen3.8 MAX low | Qwen | 10.0 | 8.8 | $0.859 | 1/1 | 96.8s |
| #80 | Claude Opus 4.8 medium | Anthropic | 6.1 | 8.3 | $3.490 | 0/1 | 99.4s |
| #99 | GPT-5.4 Mini medium | OpenAI | 10.0 | 7.9 | $1.008 | 1/1 | 100.7s |