स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: कुल लागत ↑.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #177 | Qwen3.5-Flash none | Qwen | 10.0 | 6.7 | $0.089 | 1/1 | 53.8s |
| #229 | Gemini 3.1 Flash Lite Preview none | 5.0 | 6.2 | $0.090 | 0/1 | 48.6s | |
| #122 | GPT-5.6 Luna medium | OpenAI | 7.4 | 7.4 | $0.101 | 0/1 | 58.1s |
| #211 | LongCat 2.0 none | Meituan | 6.1 | 6.4 | $0.104 | 0/1 | 81.8s |
| #284 | Qwen3.6 35B A3B none | Qwen | 5.2 | 5.3 | $0.105 | 0/1 | 65.6s |
| #276 | Step 3.5 Flash medium | Stepfun | 2.8 | 5.4 | $0.105 | 0/1 | 172.2s |
| #378 | Gemini 3 Flash Preview high | 10.0 | 1.8 | $0.105 | 1/1 | 52.5s | |
| #346 | Qwen3.5-9B medium | Qwen | 5.2 | 4.0 | $0.106 | 0/1 | 152.9s |
| #324 | Laguna S 2.1 low | Poolside | 2.8 | 4.6 | $0.109 | 0/1 | 152.1s |
| #287 | Nemotron 3.5 Lightning high | NVIDIA | 3.5 | 5.2 | $0.111 | 0/1 | 491.0s |
| #150 | GLM 5.3 FlashX medium | Z.ai | 10.0 | 7.1 | $0.114 | 1/1 | 74.4s |
| #241 | Seed-2.0-Lite none | Bytedance Seed | 5.0 | 6.0 | $0.114 | 0/1 | 76.0s |
| #139 | Qwen3.5-27B none | Qwen | 10.0 | 7.2 | $0.116 | 1/1 | 124.5s |
| #325 | Nemotron 3.5 Lightning low | NVIDIA | 3.5 | 4.6 | $0.117 | 0/1 | 597.6s |
| #164 | Gemma 4 31B medium | 10.0 | 6.9 | $0.117 | 1/1 | 82.1s |