Kushindwa kwa Jibu lisilo sahihi
Ona ni modeli gani za AI hukutana na Jibu lisilo sahihi mara nyingi zaidi ili utambue hatari za utegemevu kabla ya kuchagua. Panga kwa: Alama ↓.
Modeli zilizoonyeshwa
15
Jumla ya kushindwa
1558
Modeli iliyoathirika zaidi
Gemini 3 Flash Preview 1Kategoria
Katika kategoria Mahususi kwa domeni412 Katika kategoria Mbinu za kupinga AI293 Katika kategoria Uandishi wa msimbo252 Katika kategoria Utatuzi wa mafumbo201 Katika kategoria Maarifa ya jumla168 Katika kategoria Mchanganyiko68 Katika kategoria Ufuataji wa maagizo61 Katika kategoria Akili ya jumla59 Katika kategoria Uchanganuzi na uchimbaji wa data41 Katika kategoria Mwito wa zana3
209/209
Chuja miundo
Hakuna miundo inayolingana na utafutaji na vichujio vya sasa.
| Nafasi | Modeli | Kampuni | Idadi ya Jibu lisilo sahihi | Alama | Jumla ya gharama | Majaribio sahihi | Muda wa majibu (wastani) |
|---|---|---|---|---|---|---|---|
| #16 | Muse Spark 1.1 medium | Meta | 4 | 8.6 | $1.357 | 15/22 | 25.0s |
| #17 | Claude Fable 5 medium | Anthropic | 2 | 8.6 | $3.478 | 17/22 | 17.2s |
| #18 | GPT-5.4 medium | OpenAI | 5 | 8.5 | $1.533 | 15/22 | 23.1s |
| #19 | Qwen3.6 Max Preview medium | Qwen | 5 | 8.4 | $1.143 | 16/22 | 67.5s |
| #20 | Grok 4.5 low | X AI | 6 | 8.4 | $0.935 | 16/22 | 15.6s |
| #21 | GPT-5.2 medium | OpenAI | 3 | 8.4 | $0.951 | 14/22 | 22.6s |
| #22 | Grok 4.5 medium | X AI | 6 | 8.3 | $1.928 | 16/22 | 61.7s |
| #23 | Claude Sonnet 5 medium | Anthropic | 4 | 8.3 | $0.922 | 16/22 | 12.5s |
| #24 | Muse Spark 1.1 low | Meta | 6 | 8.3 | $0.647 | 13/22 | 11.5s |
| #25 | Gemini 2.5 Flash medium | 6 | 8.2 | $0.643 | 15/22 | 21.2s | |
| #26 | GPT-5 Mini medium | OpenAI | 5 | 8.1 | $0.237 | 12/22 | 27.6s |
| #27 | Muse Spark 1.1 high | Meta | 4 | 8.1 | $1.694 | 12/22 | 31.5s |
| #28 | Inkling high | Thinkingmachines | 4 | 8.0 | $1.006 | 15/22 | 64.2s |
| #29 | Step 3.7 Flash medium | Stepfun | 5 | 8.0 | $0.515 | 14/22 | 26.4s |
| #30 | GPT-5.2 Chat none | OpenAI | 6 | 8.0 | $0.604 | 14/22 | 7.65s |