स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं।
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #178 | Solar Pro 4 low | Upstage | 6.1 | 6.7 | $0.174 | 0/1 | 345.4s |
| #186 | GLM 5.2 none | Z.ai | 6.1 | 6.6 | $0.152 | 0/1 | 46.9s |
| #188 | LongCat 2.0 low | Meituan | 6.1 | 6.6 | $0.495 | 0/1 | 145.6s |
| #193 | Qwen3.6 35B A3B medium | Qwen | 6.1 | 6.5 | $0.812 | 0/1 | 88.5s |
| #194 | Mercury 2.5 Preview high | Inception | 6.1 | 6.5 | $0.039 | 0/1 | 86.8s |
| #200 | Laguna XS 2.1 medium | Poolside | 6.1 | 6.4 | $0.083 | 0/1 | 66.4s |
| #209 | Dots 3 Note Preview high | Dots Studio | 6.1 | 6.4 | $0.000 | 0/1 | 129.1s |
| #210 | Dots 3 Note Preview low | Dots Studio | 6.1 | 6.4 | $0.000 | 0/1 | 161.2s |
| #211 | LongCat 2.0 none | Meituan | 6.1 | 6.4 | $0.104 | 0/1 | 81.8s |
| #220 | Space Bunny Alpha medium | Stealth | 6.1 | 6.3 | $0.000 | 0/1 | 153.1s |
| #232 | Trinity Large Thinking medium | Arcee AI | 6.1 | 6.1 | $0.820 | 0/1 | 52.5s |
| #234 | Qwen3.5 Plus 2026-04-20 none | Qwen | 6.1 | 6.1 | $0.226 | 0/1 | 137.1s |
| #270 | Seed-2.0-Code none | Bytedance Seed | 6.1 | 5.4 | $0.257 | 0/1 | 80.0s |
| #277 | Ember-1 none | Fireworks | 6.1 | 5.4 | $0.786 | 0/1 | 92.9s |
| #280 | Granite 4.2 8B low | IBM Granite | 6.1 | 5.3 | $0.036 | 0/1 | 142.7s |