स्वायत्त एजेंट कार्य रैंकिंग
देखें कि स्वायत्त एजेंट कार्य में कौन से AI मॉडल सबसे अच्छा प्रदर्शन करते हैं, कौन से भरोसेमंद बने रहते हैं और सबसे बड़े अंतर कहाँ दिखाई देते हैं। क्रमबद्ध करें: कुल लागत ↓.
380/380
मॉडल फ़िल्टर करें
मौजूदा खोज और फ़िल्टर से कोई मॉडल मेल नहीं खाता।
| रैंक | मॉडल | कंपनी | स्वायत्त एजेंट कार्य स्कोर | स्कोर | कुल लागत | सही परीक्षण | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|
| #53 | GPT-5.2 medium | OpenAI | 10.0 | 8.7 | $1.540 | 1/1 | 75.9s |
| #34 | Pareto none | Unbiased | 10.0 | 9.1 | $1.520 | 1/1 | 76.5s |
| #60 | Claude Sonnet 5.5 xhigh | Anthropic | 10.0 | 8.6 | $1.516 | 1/1 | 54.9s |
| #1 | Gemini 3.6 Flash high | 10.0 | 9.9 | $1.512 | 1/1 | 65.6s | |
| #157 | Ember-1 low | Fireworks | 4.7 | 7.0 | $1.488 | 0/1 | 121.3s |
| #120 | Seed-2.0-Code high | Bytedance Seed | 10.0 | 7.5 | $1.448 | 1/1 | 139.9s |
| #64 | Claude Sonnet 5 medium | Anthropic | 10.0 | 8.5 | $1.438 | 1/1 | 69.3s |
| #176 | Grok Build 0.1 medium | X AI | 3.4 | 6.7 | $1.419 | 0/1 | 69.0s |
| #6 | GPT-6.1 Sol xhigh | OpenAI | 10.0 | 9.9 | $1.377 | 1/1 | 58.9s |
| #189 | Step 3.7 Flash high | Stepfun | 5.4 | 6.6 | $1.350 | 0/1 | 130.4s |
| #108 | Grok 4.5 low | X AI | 5.0 | 7.8 | $1.345 | 0/1 | 61.5s |
| #168 | Kimi K2.6 medium | Moonshot AI | 5.0 | 6.8 | $1.323 | 0/1 | 233.9s |
| #32 | GPT-5.3-Codex medium | OpenAI | 10.0 | 9.1 | $1.318 | 1/1 | 61.9s |
| #89 | Gemini 3.5 Flash medium | 3.8 | 8.1 | $1.308 | 0/1 | 83.6s | |
| #125 | Seed-2.0-Code medium | Bytedance Seed | 10.0 | 7.4 | $1.275 | 1/1 | 91.7s |