Kushindwa kwa Jibu lisilo sahihi
Ona ni modeli gani za AI hukutana na Jibu lisilo sahihi mara nyingi zaidi ili utambue hatari za utegemevu kabla ya kuchagua. Panga kwa: Muda wa majibu (wastani) ↓.
Kategoria
Katika kategoria Mahususi kwa domeni731 Katika kategoria Mbinu za kupinga AI423 Katika kategoria Uandishi wa msimbo401 Katika kategoria Utatuzi wa mafumbo300 Katika kategoria Maarifa ya jumla269 Katika kategoria Mchanganyiko108 Katika kategoria Akili ya jumla105 Katika kategoria Ufuataji wa maagizo88 Katika kategoria Uchanganuzi na uchimbaji wa data67 Katika kategoria Mwito wa zana5
351/351
Chuja miundo
Hakuna miundo inayolingana na utafutaji na vichujio vya sasa.
| Nafasi | Modeli | Kampuni | Idadi ya Jibu lisilo sahihi | Alama | Jumla ya gharama | Majaribio sahihi | Muda wa majibu (wastani) |
|---|---|---|---|---|---|---|---|
| #135 | Grok 4.6 low | X AI | 7 | 7.4 | $0.449 | 15/22 | 14.6s |
| #26 | Gemini 3.8 Flash medium | 2 | 9.1 | $0.653 | 19/22 | 14.5s | |
| #338 | Ling 3.0 Tiny none | Inclusionai | 13 | 4.0 | $0.000 | 2/22 | 14.0s |
| #209 | Ling-3.0-flash high | Inclusionai | 7 | 6.4 | $0.021 | 12/22 | 13.7s |
| #179 | GLM 5.3 low | Z.ai | 8 | 6.8 | $0.154 | 12/22 | 13.6s |
| #31 | Claude Fable 5.1 high | Anthropic | 3 | 9.0 | $3.364 | 19/22 | 13.6s |
| #117 | GPT-5.4 Nano medium | OpenAI | 8 | 7.5 | $0.142 | 12/22 | 13.3s |
| #229 | Qwen3.5 Plus 2026-04-20 none | Qwen | 12 | 6.1 | $0.122 | 8/22 | 13.1s |
| #45 | Claude Opus 4.8 medium | Anthropic | 4 | 8.8 | $1.983 | 17/22 | 13.0s |
| #255 | Qwen3.5-122B-A10B none | Qwen | 13 | 5.7 | $0.247 | 6/22 | 12.9s |
| #336 | Hy3 preview none | Tencent | 8 | 4.0 | $0.007 | 4/21 | 12.9s |
| #103 | Claude Opus 4.8 low | Anthropic | 4 | 7.8 | $2.089 | 16/22 | 12.9s |
| #238 | Qwen3.5-35B-A3B none | Qwen | 13 | 5.9 | $0.151 | 6/22 | 12.7s |
| #15 | GPT-5.6 Sol medium | OpenAI | 4 | 9.4 | $0.508 | 18/22 | 12.6s |
| #77 | Claude Sonnet 5 medium | Anthropic | 5 | 8.2 | $0.922 | 15/22 | 12.5s |