average score iko karibu sawa: 7.9 vs 7.9. Gharama ya maunzi ya ndani haikupimwa, kwa hiyo ulinganisho wa gharama haupatikani. GPT-5.2 Chat ni ya haraka zaidi: 7.73s vs 39.11s, na pass rates 69.7% vs 68.2%.
Benchmark zimetengenezwa kutoka seti za majaribio za AI BENCHY tarehe:
2026-08-15
Nafasi
#59
Jumla ya tokeni za matokeo
29,742
Muda wa majibu (wastani)
7.73s
Jumla ya gharama
$0.594
Nafasi
#61
Jumla ya tokeni za matokeo
169,329
Muda wa majibu (wastani)
39.11s
Jumla ya gharama
Haipo
Muundo unaopendekezwaGPT-5.2 Chat
It has the best score here (7.9), while responding about 5.1x faster than Qwen3.8 27B (low).
Qwen3.8 27BQwen3.8 27BlowMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.Toleo: 2026-08-14
Alama
7.9Wastani wa alama katika majaribio yote ya benchmark.…
7.9Wastani wa alama katika majaribio yote ya benchmark.…
Nafasi
#59
#61
Uaminifu
10.0Alama ya mafanikio ya jaribio la kwanza: 10.0 humaanisha hakuna hitilafu za API lengwa au kikomo cha kasi zinazoweza kujaribiwa tena kabla ya miito iliyofanikiwa; hitilafu zilizorekodiwa hushusha alama.…
10.0Alama ya mafanikio ya jaribio la kwanza: 10.0 humaanisha hakuna hitilafu za API lengwa au kikomo cha kasi zinazoweza kujaribiwa tena kabla ya miito iliyofanikiwa; hitilafu zilizorekodiwa hushusha alama.…
Uthabiti
8.6Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
Majaribio
66/66
66/66
Majaribio sahihi
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 6Hitilafu ya API: 1Hakufuata maelekezo: 1Hakuna jibu: 1Muda wa majibu (wastani)7.73sMuda wa majibu (upeo)38.52sMuda wa majibu (jumla)162.40sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 4Hakuna jibu: 2Hakufuata maelekezo: 1Muda wa majibu (wastani)39.11sMuda wa majibu (upeo)376.04sMuda wa majibu (jumla)860.51sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
Kiwango cha kupita kwa kila jaribio
69.7%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
68.2%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
Majaribio yasiyo thabiti
4Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jumla ya uendeshaji
66Jumla ya uendeshaji…
66Jumla ya uendeshaji…
Gharama kwa matokeo
4.564Huonyesha gharama ya wastani kwa kila jibu sahihi la benchmark kwa senti (kadri ilivyo ndogo, ndivyo bora).…
HaipoHuonyesha gharama ya wastani kwa kila jibu sahihi la benchmark kwa senti (kadri ilivyo ndogo, ndivyo bora).…
Jumla ya gharama
$0.594Jumla ya gharama (bei ya sasa)…
HaipoJumla ya gharama (bei ya sasa)…
Bei ya ingizo
$1.750 / 1MBei ya ingizo…
HaipoBei ya ingizo…
Bei ya toleo
$14.000 / 1MBei ya toleo…
HaipoBei ya toleo…
Jumla ya tokeni za ingizo
101,104Jumla ya tokeni za ingizo…
99,705Jumla ya tokeni za ingizo…
Tokeni za matokeo
29,742Tokeni za matokeo…
1,545Tokeni za matokeo…
Tokeni za hoja
0Tokeni za hoja…
167,784Tokeni za hoja…
Muda wa majibu (wastani)
7.73sMuda wa majibu (wastani)…
39.11sMuda wa majibu (wastani)…
Muda wa majibu (upeo)
38.52sMuda wa majibu (upeo)…
376.04sMuda wa majibu (upeo)…
Muda wa majibu (jumla)
162.40sMuda wa majibu (jumla)…
860.51sMuda wa majibu (jumla)…
Vigezo
~400B jumla (~17B vinavyotumika)
27.3B
Upatikanaji
Imefungwa
Uzani unapatikana
Onyesho la kizazi cha modeli
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#59 GPT-5.2 Chat
none
Gharama
$0.010
Muda
15.3s
Tokeni
797 tok
#61 Qwen3.8 27B
lowMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
8.7Wastani wa alama katika majaribio yote ya benchmark.…
7.9Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
91.7%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
1Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 1Muda wa majibu (wastani)3.40sMuda wa majibu (upeo)4.78sMuda wa majibu (jumla)13.59sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
3.40sMuda wa majibu (wastani)…
606Jumla ya tokeni za ingizo…
1,807Tokeni za matokeo…
0Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
10.0Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
100.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hakuna majibu yaliyoshindwa.Muda wa majibu (wastani)3.02sMuda wa majibu (upeo)5.68sMuda wa majibu (jumla)12.07sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
8.8Wastani wa alama katika majaribio yote ya benchmark.…
7.8Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
88.9%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
1Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 1Muda wa majibu (wastani)9.82sMuda wa majibu (upeo)13.35sMuda wa majibu (jumla)29.45sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
9.82sMuda wa majibu (wastani)…
7,305Jumla ya tokeni za ingizo…
6,731Tokeni za matokeo…
0Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
7.7Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
66.7%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hakuna jibu: 1Muda wa majibu (wastani)140.92sMuda wa majibu (upeo)376.04sMuda wa majibu (jumla)422.75sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
7.3Wastani wa alama katika majaribio yote ya benchmark.…
5.8Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
83.3%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
1Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hakuna jibu: 1Muda wa majibu (wastani)13.91sMuda wa majibu (upeo)18.70sMuda wa majibu (jumla)27.82sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
13.91sMuda wa majibu (wastani)…
78,055Jumla ya tokeni za ingizo…
7,923Tokeni za matokeo…
0Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
10.0Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
100.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hakuna majibu yaliyoshindwa.Muda wa majibu (wastani)90.63sMuda wa majibu (upeo)143.71sMuda wa majibu (jumla)181.27sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
10.0Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
100.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hakuna majibu yaliyoshindwa.Muda wa majibu (wastani)3.05sMuda wa majibu (upeo)3.33sMuda wa majibu (jumla)6.10sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
3.05sMuda wa majibu (wastani)…
7,140Jumla ya tokeni za ingizo…
980Tokeni za matokeo…
0Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
10.0Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
100.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hakuna majibu yaliyoshindwa.Muda wa majibu (wastani)8.03sMuda wa majibu (upeo)9.09sMuda wa majibu (jumla)16.06sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
3.0Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
0.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 2Hitilafu ya API: 1Muda wa majibu (wastani)23.67sMuda wa majibu (upeo)38.52sMuda wa majibu (jumla)47.34sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
23.67sMuda wa majibu (wastani)…
579Jumla ya tokeni za ingizo…
7,128Tokeni za matokeo…
0Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
5.3Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
33.3%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 2Muda wa majibu (wastani)60.78sMuda wa majibu (upeo)120.94sMuda wa majibu (jumla)182.34sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
4.4Wastani wa alama katika majaribio yote ya benchmark.…
3.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
33.3%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
1Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hakufuata maelekezo: 1Muda wa majibu (wastani)3.20sMuda wa majibu (upeo)3.20sMuda wa majibu (jumla)3.20sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
3.20sMuda wa majibu (wastani)…
477Jumla ya tokeni za ingizo…
335Tokeni za matokeo…
0Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
5.0Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
0.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hakufuata maelekezo: 1Muda wa majibu (wastani)5.37sMuda wa majibu (upeo)5.37sMuda wa majibu (jumla)5.37sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
9.8Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
100.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hakuna majibu yaliyoshindwa.Muda wa majibu (wastani)5.51sMuda wa majibu (upeo)6.55sMuda wa majibu (jumla)11.02sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
5.51sMuda wa majibu (wastani)…
660Jumla ya tokeni za ingizo…
1,441Tokeni za matokeo…
0Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
10.0Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
100.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hakuna majibu yaliyoshindwa.Muda wa majibu (wastani)2.43sMuda wa majibu (upeo)2.87sMuda wa majibu (jumla)4.86sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
7.7Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
66.7%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 1Muda wa majibu (wastani)4.10sMuda wa majibu (upeo)5.04sMuda wa majibu (jumla)12.31sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
4.10sMuda wa majibu (wastani)…
642Jumla ya tokeni za ingizo…
1,603Tokeni za matokeo…
0Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
7.7Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
66.7%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 1Muda wa majibu (wastani)4.91sMuda wa majibu (upeo)8.81sMuda wa majibu (jumla)14.74sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
10.0Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
100.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hakuna majibu yaliyoshindwa.Muda wa majibu (wastani)4.68sMuda wa majibu (upeo)4.68sMuda wa majibu (jumla)4.68sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
4.68sMuda wa majibu (wastani)…
5,445Jumla ya tokeni za ingizo…
555Tokeni za matokeo…
0Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
3.0Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
0.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 1Muda wa majibu (wastani)8.42sMuda wa majibu (upeo)8.42sMuda wa majibu (jumla)8.42sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
3.0Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
0.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Jibu lisilo sahihi: 1Muda wa majibu (wastani)6.89sMuda wa majibu (upeo)6.89sMuda wa majibu (jumla)6.89sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…
6.89sMuda wa majibu (wastani)…
195Jumla ya tokeni za ingizo…
1,239Tokeni za matokeo…
0Tokeni za hoja…
Qwen3.8 27BMajibu ya modeli iliyopimwa yalitolewa kwenye maunzi ya ndani. OpenRouter ilitumika kwa tathmini pekee.
3.0Wastani wa alama katika majaribio yote ya benchmark.…
10.0Alama ya uthabiti inaonyesha utulivu kati ya run (10 = thabiti sana, hata ikiwa ni makosa mfululizo).…
0.0%Kiwango cha kupita kwa kila jaribio = majaribio yaliyopita / jumla ya majaribio katika run zote.…
0Majaribio yasiyo thabiti yalikuwa na matokeo mchanganyiko kati ya run (angalau kupita moja na kufeli moja).…
Jaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.Hakuna jibu: 1Muda wa majibu (wastani)12.64sMuda wa majibu (upeo)12.64sMuda wa majibu (jumla)12.64sJaribio huhesabiwa kuwa limepita kikamilifu tu ikiwa run zake zote zimepita.…