KAT-Coder-Air V2.5 (high) inaongoza kwa average score: 5.6 vs 5.5. Gharama ya maunzi ya ndani haikupimwa, kwa hiyo ulinganisho wa gharama haupatikani. Qwen3.8 27B ni ya haraka zaidi: 3.12s vs 15.87s, na pass rates 42.4% vs 40.9%.
Benchmark zimetengenezwa kutoka seti za majaribio za AI BENCHY tarehe:
2026-08-15
Nafasi
#201
Jumla ya tokeni za matokeo
114,654
Muda wa majibu (wastani)
15.87s
Jumla ya gharama
$0.077
Nafasi
#211
Jumla ya tokeni za matokeo
11,445
Muda wa majibu (wastani)
3.12s
Jumla ya gharama
Haipo
Muundo unaopendekezwaQwen3.8 27B
Its score stays close to the best score here (5.5 vs 5.6), while responding about 5.1x faster than KAT-Coder-Air V2.5 (high).
Qwen3.8 27BQwen3.8 27BnoneMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.Toleo: 2026-08-14
Alama
5.6Wastani wa alama katika majaribio yote ya benchmark.…
5.5Wastani wa alama katika majaribio yote ya benchmark.…
Nafasi
#201
#211
Uaminifu
9.8Alama ya mafanikio ya jaribio la kwanza: 10.0 humaanisha hakuna hitilafu za API lengwa au kikomo cha kasi zinazoweza kujaribiwa tena kabla ya miito iliyofanikiwa; hitilafu zilizorekodiwa hushusha alama.…
10.0Alama ya mafanikio ya jaribio la kwanza: 10.0 humaanisha hakuna hitilafu za API lengwa au kikomo cha kasi zinazoweza kujaribiwa tena kabla ya miito iliyofanikiwa; hitilafu zilizorekodiwa hushusha alama.…
Uthabiti
8.1Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
Majaribio
66/66
66/66
Majaribio sahihi
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 9Hitilafu ya API: 3Muundo wa ziada: 3Muda wa majibu (wastani)15.87sMuda wa majibu (upeo)118.35sMuda wa majibu (jumla)349.16sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 11Hakufuata maelekezo: 1Mwito wa zana si sahihi: 1Muda wa majibu (wastani)3.12sMuda wa majibu (upeo)44.76sMuda wa majibu (jumla)68.69sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
Kiwango cha kupita kwa kila jaribio
42.4%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
40.9%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
Majaribio yasiyo thabiti
5Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jumla ya uendeshaji
66Jumla ya uendeshaji…
66Jumla ya uendeshaji…
Gharama kwa matokeo
1.091Huonyesha gharama ya wastani kwa kila jibu sahihi la benchmark kwa senti (kadri ilivyo ndogo, ndivyo bora).…
HaipoHuonyesha gharama ya wastani kwa kila jibu sahihi la benchmark kwa senti (kadri ilivyo ndogo, ndivyo bora).…
Jumla ya gharama
$0.077Jumla ya gharama (bei ya sasa)…
HaipoJumla ya gharama (bei ya sasa)…
Bei ya ingizo
$0.150 / 1MBei ya ingizo…
HaipoBei ya ingizo…
Bei ya toleo
$0.600 / 1MBei ya toleo…
HaipoBei ya toleo…
Jumla ya tokeni za ingizo
50,423Jumla ya tokeni za ingizo…
122,463Jumla ya tokeni za ingizo…
Tokeni za matokeo
4,144Tokeni za matokeo…
11,445Tokeni za matokeo…
Tokeni za hoja
110,510Tokeni za hoja…
0Tokeni za hoja…
Muda wa majibu (wastani)
15.87sMuda wa majibu (wastani)…
3.12sMuda wa majibu (wastani)…
Muda wa majibu (upeo)
118.35sMuda wa majibu (upeo)…
44.76sMuda wa majibu (upeo)…
Muda wa majibu (jumla)
349.16sMuda wa majibu (jumla)…
68.69sMuda wa majibu (jumla)…
Vigezo
~35B jumla (~3B vinavyotumika)
27.3B
Upatikanaji
Imefungwa
Uzani unapatikana
Onyesho la kizazi cha modeli
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#201 KAT-Coder-Air V2.5
high
SVG batili
Gharama
$0.000
Muda
300.0s
Tokeni
0 tok
#211 Qwen3.8 27B
noneMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
6.9Wastani wa alama katika majaribio yote ya benchmark.…
5.8Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
75.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
2Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hitilafu ya API: 1Jibu lisilo sahihi: 1Muda wa majibu (wastani)2.49sMuda wa majibu (upeo)3.97sMuda wa majibu (jumla)9.97sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
2.49sMuda wa majibu (wastani)…
615Jumla ya tokeni za ingizo…
204Tokeni za matokeo…
1,290Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
6.5Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
50.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 2Muda wa majibu (wastani)828msMuda wa majibu (upeo)1.95sMuda wa majibu (jumla)3.31sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
4.3Wastani wa alama katika majaribio yote ya benchmark.…
7.3Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
11.1%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
1Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hitilafu ya API: 1Muundo wa ziada: 1Jibu lisilo sahihi: 1Muda wa majibu (wastani)39.07sMuda wa majibu (upeo)104.98sMuda wa majibu (jumla)117.21sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
39.07sMuda wa majibu (wastani)…
6,948Jumla ya tokeni za ingizo…
1,166Tokeni za matokeo…
55,883Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
5.5Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
33.3%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 2Muda wa majibu (wastani)1.19sMuda wa majibu (upeo)1.97sMuda wa majibu (jumla)3.56sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
6.5Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
50.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hitilafu ya API: 1Muda wa majibu (wastani)74.48sMuda wa majibu (upeo)118.35sMuda wa majibu (jumla)148.95sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
74.48sMuda wa majibu (wastani)…
23,854Jumla ya tokeni za ingizo…
485Tokeni za matokeo…
28,559Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
3.0Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
0.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Mwito wa zana si sahihi: 1Jibu lisilo sahihi: 1Muda wa majibu (wastani)24.10sMuda wa majibu (upeo)44.76sMuda wa majibu (jumla)48.21sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
6.5Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
50.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 1Muda wa majibu (wastani)3.59sMuda wa majibu (upeo)4.92sMuda wa majibu (jumla)7.18sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
3.59sMuda wa majibu (wastani)…
7,776Jumla ya tokeni za ingizo…
284Tokeni za matokeo…
2,140Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
6.5Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
50.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 1Muda wa majibu (wastani)1.14sMuda wa majibu (upeo)1.18sMuda wa majibu (jumla)2.27sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
3.0Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
0.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Muundo wa ziada: 2Jibu lisilo sahihi: 1Muda wa majibu (wastani)7.28sMuda wa majibu (upeo)8.71sMuda wa majibu (jumla)21.85sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
7.28sMuda wa majibu (wastani)…
724Jumla ya tokeni za ingizo…
1,101Tokeni za matokeo…
7,738Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
7.7Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
66.7%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 1Muda wa majibu (wastani)552msMuda wa majibu (upeo)675msMuda wa majibu (jumla)1.66sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
5.1Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
0.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 1Muda wa majibu (wastani)7.10sMuda wa majibu (upeo)7.10sMuda wa majibu (jumla)7.10sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
7.10sMuda wa majibu (wastani)…
516Jumla ya tokeni za ingizo…
179Tokeni za matokeo…
539Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
4.2Wastani wa alama katika majaribio yote ya benchmark.…
9.9Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
0.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 1Muda wa majibu (wastani)1.31sMuda wa majibu (upeo)1.31sMuda wa majibu (jumla)1.31sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
9.8Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
100.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hakuna majibu yaliyoshindwa.Muda wa majibu (wastani)1.51sMuda wa majibu (upeo)1.91sMuda wa majibu (jumla)3.01sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
1.51sMuda wa majibu (wastani)…
699Jumla ya tokeni za ingizo…
90Tokeni za matokeo…
675Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
6.3Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
50.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 1Muda wa majibu (wastani)582msMuda wa majibu (upeo)633msMuda wa majibu (jumla)1.16sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
3.5Wastani wa alama katika majaribio yote ya benchmark.…
4.4Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
33.3%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
2Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 3Muda wa majibu (wastani)2.47sMuda wa majibu (upeo)2.86sMuda wa majibu (jumla)7.40sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
2.47sMuda wa majibu (wastani)…
696Jumla ya tokeni za ingizo…
285Tokeni za matokeo…
1,576Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
6.0Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
33.3%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hakufuata maelekezo: 1Jibu lisilo sahihi: 1Muda wa majibu (wastani)1.25sMuda wa majibu (upeo)1.84sMuda wa majibu (jumla)3.76sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
10.0Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
100.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hakuna majibu yaliyoshindwa.Muda wa majibu (wastani)4.77sMuda wa majibu (upeo)4.77sMuda wa majibu (jumla)4.77sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
4.77sMuda wa majibu (wastani)…
8,391Jumla ya tokeni za ingizo…
330Tokeni za matokeo…
1,082Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
10.0Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
100.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hakuna majibu yaliyoshindwa.Muda wa majibu (wastani)2.75sMuda wa majibu (upeo)2.75sMuda wa majibu (jumla)2.75sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
3.0Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
0.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 1Muda wa majibu (wastani)21.72sMuda wa majibu (upeo)21.72sMuda wa majibu (jumla)21.72sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
21.72sMuda wa majibu (wastani)…
204Jumla ya tokeni za ingizo…
20Tokeni za matokeo…
11,028Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
3.0Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
0.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 1Muda wa majibu (wastani)703msMuda wa majibu (upeo)703msMuda wa majibu (jumla)703msJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…