Sarcini agentice: Răspuns greșit
Sarcini agentice
Răspuns greșit
Vezi ce modele AI au cele mai mari șanse să întâmpine Răspuns greșit la Sarcini agentice, ca să găsești mai repede punctele slabe.
Motive de eșec
108/108
Filtrează modelele
Niciun model nu corespunde căutării și filtrelor curente.
| Rang | Model | Companie | Număr de Răspuns greșit | Scor de categorie | Cost total | Teste corecte | Timp de răspuns (mediu) |
|---|---|---|---|---|---|---|---|
| #265 | Kimi K2.6 none | Moonshot AI | 1 | 4.7 | $0.376 | 0/1 | 175.2s |
| #268 | Gemma 4 26B A4B none | 1 | 5.0 | $0.026 | 0/1 | 75.8s | |
| #270 | Seed-2.0-Code none | Bytedance Seed | 1 | 6.1 | $0.257 | 0/1 | 80.0s |
| #272 | Qwen3.8 27B none | Qwen | 1 | 5.0 | ~$0.010 | 0/1 | 47.4s |
| #273 | North Mini Code medium | Cohere | 1 | 3.9 | $0.000 | 0/1 | 105.2s |
| #275 | MiMo-V2.6-Flash none | Xiaomi | 1 | 5.0 | $0.060 | 0/1 | 62.6s |
| #276 | Step 3.5 Flash medium | Stepfun | 1 | 2.8 | $0.105 | 0/1 | 172.2s |
| #277 | Ember-1 none | Fireworks | 1 | 6.1 | $0.786 | 0/1 | 92.9s |
| #279 | GPT-5.6 Luna none | OpenAI | 1 | 5.0 | $0.056 | 0/1 | 53.8s |
| #280 | Granite 4.2 8B low | IBM Granite | 1 | 6.1 | $0.036 | 0/1 | 142.7s |
| #281 | Kimi K2.5 none | Moonshot AI | 1 | 5.0 | $0.236 | 0/1 | 321.2s |
| #291 | Mistral Small 4 medium | Mistral | 1 | 5.0 | $0.126 | 0/1 | 54.1s |
| #292 | Mistral Small 4 none | Mistral | 1 | 5.0 | $0.047 | 0/1 | 45.5s |
| #296 | Laguna S 2.1 medium | Poolside | 1 | 3.4 | $0.080 | 0/1 | 165.0s |
| #297 | Mercury 2.5 Preview low | Inception | 1 | 5.0 | $0.015 | 0/1 | 84.5s |