Kushindwa kwa Jibu lisilo sahihi
Ona ni modeli gani za AI hukutana na Jibu lisilo sahihi mara nyingi zaidi ili utambue hatari za utegemevu kabla ya kuchagua. Panga kwa: Muda wa majibu (wastani) ↓.
Kategoria
Katika kategoria Mahususi kwa domeni712 Katika kategoria Mbinu za kupinga AI416 Katika kategoria Uandishi wa msimbo388 Katika kategoria Utatuzi wa mafumbo296 Katika kategoria Maarifa ya jumla263 Katika kategoria Mchanganyiko106 Katika kategoria Akili ya jumla101 Katika kategoria Ufuataji wa maagizo87 Katika kategoria Uchanganuzi na uchimbaji wa data67 Katika kategoria Mwito wa zana5
340/340
Chuja miundo
Hakuna miundo inayolingana na utafutaji na vichujio vya sasa.
| Nafasi | Modeli | Kampuni | Idadi ya Jibu lisilo sahihi | Alama | Jumla ya gharama | Majaribio sahihi | Muda wa majibu (wastani) |
|---|---|---|---|---|---|---|---|
| #189 | Qwen3.6 27B medium | Qwen | 5 | 6.5 | $0.577 | 10/22 | 106.1s |
| #173 | Gemma 4 26B A4B medium | 2 | 6.8 | $0.084 | 15/22 | 104.9s | |
| #164 | Seed-2.0-Code medium | Bytedance Seed | 4 | 6.8 | $1.153 | 10/22 | 101.1s |
| #156 | Kimi K2.5 medium | Moonshot AI | 5 | 7.0 | $0.479 | 10/22 | 98.2s |
| #221 | Trinity Large Thinking low | Arcee AI | 7 | 6.0 | $0.625 | 8/22 | 96.6s |
| #73 | Muse Glimmer 30B xhigh | Meta | 4 | 8.1 | $0.510 | 13/22 | 95.6s |
| #155 | Seed-2.0-Mini medium | Bytedance Seed | 5 | 7.0 | $0.116 | 11/22 | 93.1s |
| #100 | DeepSeek V4 Pro high | DeepSeek | 7 | 7.7 | $0.424 | 10/22 | 92.5s |
| #114 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 4 | 7.5 | $0.459 | 14/22 | 91.8s |
| #321 | Granite 4.2 8B none | IBM Granite | 11 | 4.3 | $0.037 | 3/22 | 86.3s |
| #216 | Trinity Large Thinking medium | Arcee AI | 8 | 6.1 | $0.756 | 8/22 | 85.4s |
| #291 | Laguna S 2.1 low | Poolside | 15 | 5.0 | $0.082 | 3/22 | 85.3s |
| #135 | DeepSeek V4 Flash 0731 medium | DeepSeek | 5 | 7.3 | $0.216 | 11/22 | 84.7s |
| #214 | Qwen3.5-Flash medium | Qwen | 5 | 6.1 | $0.142 | 11/22 | 84.4s |
| #17 | Grok 4.6 high | X AI | 2 | 9.3 | $1.908 | 19/22 | 84.1s |