Ubao wa Viwango wa AI Benchy
Benchmark zimetengenezwa kutoka seti za majaribio za AI BENCHY tarehe: 2026-09-02
Modeli zilizotathminiwa: 305
Miundo inayopendekezwa
GPT-5.6 Sol
high
Yenye akili
Kiwango cha kupita kwa kila jaribio
89.4%
Majaribio sahihi
18 / 22
Alama
9.4/10
GPT-5.6 Luna
medium
Haraka
Muda wa majibu (wastani)
7.43s
Jumla ya tokeni za matokeo
44,525
Alama
7.4/10
DeepSeek V4 Flash 0731
high
Nafuu
Bei ya ingizo
$0.065 / 1M
Bei ya toleo
$0.180 / 1M
Alama
8.0/10
305/305
Chuja miundo
Hakuna miundo inayolingana na utafutaji na vichujio vya sasa.
| Nafasi | Modeli | Alama Wastani wa alama katika majaribio yote ya benchmark. | Kampuni | Jumla ya gharama | Muda wa majibu (wastani) Muda wa majibu (wastani) | Majaribio sahihi Inaonyesha majaribio mangapi yamepita kikamilifu (run zote zimepita). |
|---|---|---|---|---|---|---|
| #305#305 | LFM2-24B-A2BnoneModeli iliyohifadhiwa: modeli hii haitasasishwa tena wala kujaribiwa kwenye majaribio mapya. | 2.2… | Liquid | $0.001 … | 782ms… | Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita. Jibu lisilo sahihi: 9 Hitilafu ya API: 4 Hakufuata maelekezo: 1 Muda wa majibu (wastani)782ms Muda wa majibu (upeo)3.15s Muda wa majibu (jumla)10.94s … |
|
||||||
| #303#303 | Nemotron 3 Nano Omni 30b A3b ReasoningnoneModeli iliyohifadhiwa: modeli hii haitasasishwa tena wala kujaribiwa kwenye majaribio mapya. | 3.2… | NVIDIA | $0.000 … | 728ms… | Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita. Jibu lisilo sahihi: 9 Hitilafu ya API: 6 Hakufuata maelekezo: 2 Muda wa majibu (wastani)728ms Muda wa majibu (upeo)2.21s Muda wa majibu (jumla)9.47s … |
|
||||||
| #279#279 | Laguna S 2.1none | 4.5… | Poolside | $0.022 ↓ … | 11.67s… | Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita. Jibu lisilo sahihi: 18 Hakufuata maelekezo: 1 Hakuna jibu: 1 Muda wa majibu (wastani)11.67s Muda wa majibu (upeo)200.52s Muda wa majibu (jumla)256.71s … |
|
||||||
| #291#291 | Ling 3.0 Tinynone | 4.0… | Inclusionai | $0.000 … | 14.02s… | Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita. Jibu lisilo sahihi: 13 Hakufuata maelekezo: 4 Hitilafu ya API: 1 Muundo wa ziada: 1 Mwito wa zana si sahihi: 1 Muda wa majibu (wastani)14.02s Muda wa majibu (upeo)240.61s Muda wa majibu (jumla)294.46s … |
Jibu lisilo sahihi: 13 Hakufuata maelekezo: 4 Hitilafu ya API: 1 Muundo wa ziada: 1 Mwito wa zana si sahihi: 1
|
||||||
| #292#292 | Granite 4.1 8Bnone | 4.0… | IBM Granite | $0.007 … | 1.44s… | Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita. Jibu lisilo sahihi: 13 Hakufuata maelekezo: 4 Mwito wa zana si sahihi: 2 Muundo wa ziada: 1 Muda wa majibu (wastani)1.44s Muda wa majibu (upeo)16.67s Muda wa majibu (jumla)31.75s … |
|
||||||
Mienendo ya jumla ya benchmark
Ona jinsi modeli za sasa zinavyosawazisha alama, gharama, kasi, urefu wa matokeo na uwezo kwa kila kategoria.
Maendeleo ya alama bora za kampuni zinazoongoza
Mpaka wa Pareto: akili dhidi ya kasi ya majibu
Mpaka wa Pareto: alama dhidi ya tokeni za matokeo
Ugumu wa kategoria katika modeli zote
Ulinganisho wa haraka
Gemini 3.6 FlashhighvsGemini 3.7 FlashhighGemini 3.7 FlashhighvsGemini 3.6 FlashmediumGemini 3.6 FlashmediumvsGPT-5.6 SollowGPT-5.6 SollowvsGemini 3 Flash PreviewmediumGemini 3 Flash PreviewmediumvsGemini 3.5 FlashhighGemini 3.5 FlashhighvsGemini 3.7 FlashmediumGemini 3.7 FlashmediumvsGPT-5.6 SolmediumGPT-5.6 SolmediumvsGPT-5.6 SolhighGPT-5.6 SolhighvsGPT-5.5lowGPT-5.5lowvsGrok 4.6highGrok 4.6highvsGemini 3.1 Pro PreviewmediumGemini 3.1 Pro PreviewmediumvsGemini 3.7 Flashlow