Kushindwa kwa Jibu lisilo sahihi
Ona ni modeli gani za AI hukutana na Jibu lisilo sahihi mara nyingi zaidi ili utambue hatari za utegemevu kabla ya kuchagua. Panga kwa: Alama ↓.
Kategoria
Katika kategoria Mahususi kwa domeni421 Katika kategoria Mbinu za kupinga AI293 Katika kategoria Uandishi wa msimbo259 Katika kategoria Utatuzi wa mafumbo204 Katika kategoria Maarifa ya jumla172 Katika kategoria Mchanganyiko69 Katika kategoria Akili ya jumla62 Katika kategoria Ufuataji wa maagizo61 Katika kategoria Uchanganuzi na uchimbaji wa data41 Katika kategoria Mwito wa zana3
215/215
Chuja miundo
Hakuna miundo inayolingana na utafutaji na vichujio vya sasa.
| Nafasi | Modeli | Kampuni | Idadi ya Jibu lisilo sahihi | Alama | Jumla ya gharama | Majaribio sahihi | Muda wa majibu (wastani) |
|---|---|---|---|---|---|---|---|
| #62 | Qwen3.5-27B medium | Qwen | 4 | 7.4 | $1.627 | 13/22 | 111.9s |
| #63 | Qwen3.7 Max none | Qwen | 7 | 7.4 | $0.197 | 15/22 | 4.52s |
| #64 | LongCat 2.0 medium | Meituan | 7 | 7.4 | $0.478 | 12/22 | 136.6s |
| #65 | Gemini 3 Flash Preview low | 6 | 7.4 | $0.177 | 16/22 | 6.28s | |
| #66 | KAT-Coder-Pro V2.5 low | Kwaipilot | 10 | 7.4 | $0.387 | 11/22 | 19.5s |
| #67 | Claude Sonnet 4.6 none | Anthropic | 5 | 7.3 | $0.661 | 12/22 | 8.12s |
| #68 | Gemini 3.1 Flash Lite Preview medium | 7 | 7.3 | $0.115 | 13/22 | 4.61s | |
| #69 | Gemini 3.1 Flash Lite medium | 7 | 7.3 | $0.117 | 13/22 | 4.27s | |
| #70 | Claude Opus 4.8 none | Anthropic | 4 | 7.3 | $1.166 | 13/22 | 4.91s |
| #71 | Step 3.7 Flash low | Stepfun | 8 | 7.3 | $0.454 | 12/22 | 20.7s |
| #72 | Kimi K2.6 medium | Moonshot AI | 3 | 7.2 | $1.036 | 12/22 | 110.0s |
| #73 | KAT-Coder-Pro V2.5 high | Kwaipilot | 10 | 7.2 | $0.482 | 11/22 | 20.8s |
| #74 | Qwen3.5 Plus 2026-04-20 medium | Qwen | 8 | 7.2 | $0.317 | 13/22 | 46.4s |
| #75 | Qwen3.7 Plus none | Qwen | 10 | 7.2 | $0.106 | 11/22 | 12.1s |
| #76 | Qwen3.5-122B-A10B medium | Qwen | 5 | 7.1 | $1.046 | 14/22 | 64.2s |