Maarifa ya jumla: Jibu lisilo sahihi
Maarifa ya jumla
Jibu lisilo sahihi
Ona ni modeli gani za AI zina uwezekano mkubwa wa kupata Jibu lisilo sahihi katika Maarifa ya jumla, ili uone udhaifu haraka. Panga kwa: Majaribio sahihi ↓.
Sababu za kushindwa
197/197
Chuja miundo
Hakuna miundo inayolingana na utafutaji na vichujio vya sasa.
| Nafasi | Modeli | Kampuni | Idadi ya Jibu lisilo sahihi | Alama ya kategoria | Jumla ya gharama | Majaribio sahihi | Muda wa majibu (wastani) |
|---|---|---|---|---|---|---|---|
| #6 | GPT-5.6 Sol medium | OpenAI | 1 | 4.7 | $1.316 | 0/1 | 4.94s |
| #7 | GPT-5.6 Sol high | OpenAI | 1 | 4.7 | $1.234 | 0/1 | 6.97s |
| #8 | GPT-5.5 low | OpenAI | 1 | 3.0 | $1.253 | 0/1 | 10.1s |
| #12 | Qwen3.7 Max medium | Qwen | 1 | 3.0 | $1.116 | 0/1 | 33.4s |
| #14 | Qwen3.8 Max medium | Qwen | 1 | 3.0 | $0.728 | 0/1 | 11.5s |
| #15 | GPT-5.5 medium | OpenAI | 1 | 2.8 | $4.137 | 0/1 | 37.9s |
| #18 | GPT-5.3-Codex medium | OpenAI | 1 | 2.8 | $0.920 | 0/1 | 14.4s |
| #20 | Muse Spark 1.2 high | Meta | 1 | 3.0 | $1.632 | 0/1 | 15.0s |
| #21 | Gemini 3.5 Flash Lite high | 1 | 3.0 | $0.538 | 0/1 | 9.68s | |
| #23 | Claude Opus 4.7 medium | Anthropic | 1 | 3.0 | $1.477 | 0/1 | 2.25s |
| #24 | Qwen3.8 Max low | Qwen | 1 | 3.0 | $0.687 | 0/1 | 12.4s |
| #25 | Muse Spark 1.2 medium | Meta | 1 | 3.0 | $1.227 | 0/1 | 12.8s |
| #26 | Muse Spark 1.1 medium | Meta | 1 | 3.0 | $1.357 | 0/1 | 18.5s |
| #28 | Claude Opus 5 low | Anthropic | 1 | 3.0 | $1.121 | 0/1 | 6.48s |
| #29 | GPT-5.4 medium | OpenAI | 1 | 3.0 | $1.533 | 0/1 | 14.0s |