स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: सही परीक्षण ↓.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #239 | MiMo-V2.6-Pro none | Xiaomi | 5.0 | 6.0 | $0.193 | 0/1 | 66.1s |
| #240 | Inkling Small medium | Thinkingmachines | 3.0 | 6.0 | $0.118 | 0/1 | 49ms |
| #241 | Seed-2.0-Lite none | Bytedance Seed | 5.0 | 6.0 | $0.114 | 0/1 | 76.0s |
| #242 | Gemini 3.1 Flash Lite minimal | 5.0 | 5.9 | $0.080 | 0/1 | 50.0s | |
| #243 | gpt-oss-120b medium | OpenAI | 5.0 | 5.9 | $0.030 | 0/1 | 203.9s |
| #244 | Gemini 3.1 Flash Lite none | 5.0 | 5.9 | $0.069 | 0/1 | 43.8s | |
| #245 | Qwen3.6 Flash none | Qwen | 5.0 | 5.9 | $0.143 | 0/1 | 93.5s |
| #246 | Claude Sonnet 5 none | Anthropic | 4.7 | 5.9 | $1.095 | 0/1 | 64.7s |
| #247 | Nemotron 3 Ultra none | NVIDIA | 5.0 | 5.9 | $0.193 | 0/1 | 70.2s |
| #248 | Qwen3.7 Flash none | Qwen | 4.7 | 5.9 | $0.028 | 0/1 | 117.0s |
| #249 | GPT-5.6 Terra none | OpenAI | 5.0 | 5.8 | $0.516 | 0/1 | 58.0s |
| #250 | DeepSeek V4.1 Flash none | DeepSeek | 7.4 | 5.8 | $0.123 | 0/1 | 55.8s |
| #251 | Ling 3.0 Flash high | Inclusionai | 3.0 | 5.8 | $0.000 | 0/1 | 42ms |
| #252 | Ring 2.6 1t medium | Inclusionai | 3.0 | 5.7 | $0.072 | 0/1 | 21ms |
| #254 | GPT-5 Nano medium | OpenAI | 4.7 | 5.7 | $0.139 | 0/1 | 94.1s |