Kushindwa kwa Jibu lisilo sahihi
Ona ni modeli gani za AI hukutana na Jibu lisilo sahihi mara nyingi zaidi ili utambue hatari za utegemevu kabla ya kuchagua.
Kategoria
Katika kategoria Mahususi kwa domeni654 Katika kategoria Mbinu za kupinga AI386 Katika kategoria Uandishi wa msimbo361 Katika kategoria Utatuzi wa mafumbo275 Katika kategoria Maarifa ya jumla244 Katika kategoria Mchanganyiko95 Katika kategoria Akili ya jumla90 Katika kategoria Ufuataji wa maagizo82 Katika kategoria Uchanganuzi na uchimbaji wa data66 Katika kategoria Mwito wa zana5
309/309
Chuja miundo
Hakuna miundo inayolingana na utafutaji na vichujio vya sasa.
| Nafasi | Modeli | Kampuni | Idadi ya Jibu lisilo sahihi | Alama | Jumla ya gharama | Majaribio sahihi | Muda wa majibu (wastani) |
|---|---|---|---|---|---|---|---|
| #142 | Seed-2.0-Code medium | Bytedance Seed | 4 | 6.8 | $1.153 | 10/22 | 101.1s |
| #219 | Gemini 3.1 Flash Lite high | 4 | 5.6 | $2.044 | 10/18 | 62.0s | |
| #230 | Hy3 preview low | Tencent | 4 | 5.5 | $0.042 | 10/21 | 24.6s |
| #273 | Grok 4.20 Multi Agent Beta medium | X AI | 4 | 4.8 | $5.599 | 8/18 | 9.69s |
| #277 | Hunter Alpha medium | OpenRouter | 4 | 4.7 | $0.000 | 8/18 | 10.3s |
| #278 | Grok 4.1 Fast medium | X AI | 4 | 4.7 | $0.069 | 9/19 | 23.8s |
| #279 | Laguna M.1 medium | Poolside | 4 | 4.7 | $0.033 | 9/19 | 14.7s |
| #11 | GPT-5.5 low | OpenAI | 3 | 9.3 | $1.257 | 19/22 | 10.1s |
| #16 | Claude Opus 5 medium | Anthropic | 3 | 9.2 | $1.586 | 18/22 | 10.3s |
| #18 | Seed 2.1 Turbo low | Bytedance Seed | 3 | 9.1 | $1.546 | 17/22 | 163.9s |
| #20 | Claude Fable 5.1 high | Anthropic | 3 | 9.0 | $3.364 | 19/22 | 13.6s |
| #21 | Gemini 3.5 Flash medium | 3 | 9.0 | $0.665 | 18/22 | 8.48s | |
| #26 | Muse Spark 1.3 high | Meta | 3 | 8.9 | $1.653 | 16/22 | 52.5s |
| #28 | Gemini 3.5 Flash low | 3 | 8.8 | $0.449 | 18/22 | 5.76s | |
| #35 | Claude Opus 4.7 medium | Anthropic | 3 | 8.7 | $1.476 | 18/22 | 7.62s |