स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↓.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #270 | Seed-2.0-Code none | Bytedance Seed | 6.1 | 5.4 | $0.257 | 0/1 | 80.0s |
| #271 | Claude Opus 4.7 none | Anthropic | 0.0 | 5.4 | $0.505 | 0/0 | 0ms |
| #272 | Qwen3.8 27B none | Qwen | 5.0 | 5.4 | ~$0.010 | 0/1 | 47.4s |
| #273 | North Mini Code medium | Cohere | 3.9 | 5.4 | $0.000 | 0/1 | 105.2s |
| #274 | Hy4 preview low | Tencent | 4.7 | 5.4 | $1.670 | 0/1 | 52.4s |
| #275 | MiMo-V2.6-Flash none | Xiaomi | 5.0 | 5.4 | $0.060 | 0/1 | 62.6s |
| #276 | Step 3.5 Flash medium | Stepfun | 2.8 | 5.4 | $0.105 | 0/1 | 172.2s |
| #277 | Ember-1 none | Fireworks | 6.1 | 5.4 | $0.786 | 0/1 | 92.9s |
| #278 | Hy3 preview medium | Tencent | 0.0 | 5.3 | $0.049 | 0/0 | 0ms |
| #279 | GPT-5.6 Luna none | OpenAI | 5.0 | 5.3 | $0.056 | 0/1 | 53.8s |
| #280 | Granite 4.2 8B low | IBM Granite | 6.1 | 5.3 | $0.036 | 0/1 | 142.7s |
| #281 | Kimi K2.5 none | Moonshot AI | 5.0 | 5.3 | $0.236 | 0/1 | 321.2s |
| #282 | Qwen3.6 Max Preview none | Qwen | 0.0 | 5.3 | $0.228 | 0/0 | 0ms |
| #283 | Laguna XS 2.1 none | Poolside | 5.0 | 5.3 | $0.019 | 0/1 | 70.8s |
| #284 | Qwen3.6 35B A3B none | Qwen | 5.2 | 5.3 | $0.105 | 0/1 | 65.6s |