AI BENCHY
Advertise here

Kushindwa kwa kategoria za AI BENCHY

Maarifa ya jumla: Jibu lisilo sahihi

Maarifa ya jumla
Jibu lisilo sahihi

Ona ni modeli gani za AI zina uwezekano mkubwa wa kupata Jibu lisilo sahihi katika Maarifa ya jumla, ili uone udhaifu haraka.

Modeli zilizoonyeshwa

12

Jumla ya kushindwa

117

Modeli iliyoathirika zaidi

Claude Opus 4.7 1

Sababu za kushindwa

Nafasi Modeli Kampuni Idadi ya Jibu lisilo sahihi Alama ya kategoria Majaribio sahihi Muda wa majibu (wastani)
#128 MiMo-V2.5 none Xiaomi 1 3.0 0/1 3.89s
#129 Qwen3 Coder Next medium Qwen 1 3.0 0/1 399ms
#130 Trinity Large Preview none Arcee AI 1 3.0 0/1 777ms
#131 Mercury 2 none Inception 1 3.0 0/1 548ms
#132 Qwen3.5-9B none Qwen 1 3.0 0/1 2.32s
#133 HY3 Preview none Tencent 1 3.0 0/1 2.71s
#135 GPT-5.4 Nano none OpenAI 1 3.0 0/1 773ms
#136 GLM 4.7 Flash medium Z.ai 1 3.0 0/1 11.1s
#137 MiMo-V2-Flash none Xiaomi 1 3.0 0/1 1.82s
#139 Grok 4.1 Fast none X AI 1 3.0 0/1 731ms
#140 Qwen3.5-9B medium Qwen 1 3.0 0/1 177.0s
#142 Granite 4.1 8B none IBM Granite 1 3.0 0/1 306ms

Modeli bora kwa Idadi ya Jibu lisilo sahihi

Idadi ya Jibu lisilo sahihi dhidi ya Alama

Modeli bora kwa Muda wa majibu (wastani)

Modeli bora kwa Gharama iliyopotezwa inayokadiriwa