Maarifa ya jumla: Jibu lisilo sahihi
Maarifa ya jumla
Jibu lisilo sahihi
Ona ni modeli gani za AI zina uwezekano mkubwa wa kupata Jibu lisilo sahihi katika Maarifa ya jumla, ili uone udhaifu haraka.
Sababu za kushindwa
263/263
Chuja miundo
Hakuna miundo inayolingana na utafutaji na vichujio vya sasa.
| Nafasi | Modeli | Kampuni | Idadi ya Jibu lisilo sahihi | Alama ya kategoria | Jumla ya gharama | Majaribio sahihi | Muda wa majibu (wastani) |
|---|---|---|---|---|---|---|---|
| #116 | Mercury 2.5 Preview medium | Inception | 1 | 3.0 | $0.024 | 0/1 | 4.13s |
| #117 | GPT-5.4 Mini medium | OpenAI | 1 | 3.0 | $0.786 | 0/1 | 30.1s |
| #118 | Grok Build 0.1 medium | X AI | 1 | 3.0 | $1.130 | 0/1 | 53.5s |
| #120 | Gemini 3.1 Flash Lite Preview medium | 1 | 3.0 | $0.117 | 0/1 | 2.68s | |
| #121 | Qwen3.7 Max none | Qwen | 1 | 3.0 | $0.197 | 0/1 | 856ms |
| #122 | Kimi K2.7 Code medium | Moonshot AI | 1 | 3.0 | $0.655 | 0/1 | 341.8s |
| #123 | GPT-5.6 Luna medium | OpenAI | 1 | 3.0 | $0.072 | 0/1 | 6.64s |
| #124 | LongCat 2.0 medium | Meituan | 1 | 3.0 | $0.499 | 0/1 | 191.2s |
| #125 | Qwen3.8 2.4T A95B high | Qwen | 1 | 3.0 | $2.357 | 0/1 | 348.0s |
| #127 | Grok 4.6 low | X AI | 1 | 3.0 | $0.449 | 0/1 | 26.1s |
| #129 | Claude Sonnet 4.6 none | Anthropic | 1 | 3.0 | $0.661 | 0/1 | 4.67s |
| #130 | GLM 5.3 high | Z.ai | 1 | 3.0 | $0.262 | 0/1 | 22.0s |
| #131 | KAT-Coder-Pro V2.5 low | Kwaipilot | 1 | 3.0 | $0.400 | 0/1 | 17.1s |
| #133 | Gemini 3.1 Flash Lite medium | 1 | 3.0 | $0.120 | 0/1 | 3.08s | |
| #134 | Qwen3.7 Plus none | Qwen | 1 | 3.0 | $0.106 | 0/1 | 1.21s |