Clasament Sarcini agentice
Vezi ce modele AI se descurcă cel mai bine la Sarcini agentice, care rămân fiabile și unde apar cele mai mari diferențe. Sortează după: Teste corecte ↓.
380/380
Filtrează modelele
Niciun model nu corespunde căutării și filtrelor curente.
| Rang | Model | Companie | Scor Sarcini agentice | Scor | Cost total | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|---|
| #145 | LongCat 2.0 medium | Meituan | 6.1 | 7.2 | $0.593 | 0/1 | 174.1s |
| #146 | GLM 5 medium | Z.ai | 4.7 | 7.2 | $0.360 | 0/1 | 110.7s |
| #147 | Step 3.7 Flash low | Stepfun | 7.4 | 7.2 | $0.449 | 0/1 | 83.6s |
| #149 | Claude Opus 5 none | Anthropic | 5.4 | 7.1 | $2.766 | 0/1 | 79.6s |
| #151 | MiMo-V2.6-Flash low | Xiaomi | 4.7 | 7.1 | $0.200 | 0/1 | 107.9s |
| #153 | GPT-5.2 Chat none | OpenAI | 3.0 | 7.0 | $0.594 | 0/1 | 955ms |
| #154 | Qwen3.6 Max Preview medium | Qwen | 0.0 | 7.0 | $1.132 | 0/0 | 0ms |
| #155 | Gemini 3.1 Flash Lite Preview medium | 5.0 | 7.0 | $0.158 | 0/1 | 54.9s | |
| #156 | Kimi K2.7 Code medium | Moonshot AI | 5.0 | 7.0 | $0.861 | 0/1 | 104.0s |
| #157 | Ember-1 low | Fireworks | 4.7 | 7.0 | $1.488 | 0/1 | 121.3s |
| #158 | Qwen3.5-122B-A10B medium | Qwen | 6.1 | 7.0 | $1.152 | 0/1 | 95.3s |
| #159 | Grok 4.6 low | X AI | 5.0 | 6.9 | $0.781 | 0/1 | 58.0s |
| #160 | Gemini 3 Flash Preview low | 5.0 | 6.9 | $0.254 | 0/1 | 52.6s | |
| #161 | Muse Glimmer 30B low | Meta | 6.1 | 6.9 | $0.266 | 0/1 | 105.0s |
| #162 | Gemini 3.1 Flash Lite medium | 5.0 | 6.9 | $0.153 | 0/1 | 47.8s |