Qwen3.6 Plus PreviewQwen3.6 Plus PreviewmediumModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.Lansare: 2026-04-20Disponibil gratuit
Qwen3.6 Plus PreviewQwen3.6 Plus PreviewmediumModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.Lansare: 2026-04-20Disponibil gratuit
Scor
7.5Scor mediu pe toate testele de benchmark.…
8.2Scor mediu pe toate testele de benchmark.…
Rang
#48
#16
Fiabilitate
9.8Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
N/DScorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
8.1Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 3Răspuns greșit: 3Fără răspuns: 1Timp de răspuns (mediu)61.96sTimp de răspuns (maxim)149.23sTimp de răspuns (total)1115.31sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)15.25sTimp de răspuns (maxim)43.55sTimp de răspuns (total)182.96sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
74.1%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
75.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
4Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
54Rulări totale…
57Rulări totale…
Cost per rezultat
18.579Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
0.000Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$2.044Cost total…
$0.000Cost total…
Preț de intrare
$0.250 / 1MPreț de intrare…
$0.000 / 1MPreț de intrare…
Preț de ieșire
$1.500 / 1MPreț de ieșire…
$0.000 / 1MPreț de ieșire…
Tokenuri de ieșire
1,984Tokenuri de ieșire…
1,153Tokenuri de ieșire…
Tokenuri de raționament
1,355,583Tokenuri de raționament…
62,197Tokenuri de raționament…
Timp de răspuns (mediu)
61.96sTimp de răspuns (mediu)…
15.25sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
149.23sTimp de răspuns (maxim)…
43.55sTimp de răspuns (maxim)…
Timp de răspuns (total)
1115.31sTimp de răspuns (total)…
182.96sTimp de răspuns (total)…
Top modele după scor
Scor vs cost total
Timp de răspuns (mediu)
Scor vs Timp de răspuns (mediu)
Total tokenuri de ieșire
Scor vs Total tokenuri de ieșire
Defalcare pe categorii
Trucuri anti-AI
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Gemini 3.1 Flash LiteModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
9.4Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)37.16sTimp de răspuns (maxim)140.53sTimp de răspuns (total)148.65sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
37.16sTimp de răspuns (mediu)…
100Tokenuri de ieșire…
130,598Tokenuri de raționament…
Qwen3.6 Plus PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)11.69sTimp de răspuns (maxim)19.37sTimp de răspuns (total)35.08sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
11.69sTimp de răspuns (mediu)…
61Tokenuri de ieșire…
5,812Tokenuri de raționament…
Programare
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Gemini 3.1 Flash LiteModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)137.63sTimp de răspuns (maxim)137.63sTimp de răspuns (total)137.63sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
137.63sTimp de răspuns (mediu)…
666Tokenuri de ieșire…
188,733Tokenuri de raționament…
Qwen3.6 Plus PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
0.0Scor mediu pe toate testele de benchmark.…
0.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)0msTimp de răspuns (maxim)0msTimp de răspuns (total)0msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
0msTimp de răspuns (mediu)…
0Tokenuri de ieșire…
0Tokenuri de raționament…
Combinat
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Gemini 3.1 Flash LiteModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)149.23sTimp de răspuns (maxim)149.23sTimp de răspuns (total)149.23sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
149.23sTimp de răspuns (mediu)…
327Tokenuri de ieșire…
198,243Tokenuri de raționament…
Qwen3.6 Plus PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)34.95sTimp de răspuns (maxim)34.95sTimp de răspuns (total)34.95sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
34.95sTimp de răspuns (mediu)…
452Tokenuri de ieșire…
13,073Tokenuri de raționament…
Parsare și extragere de date
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Gemini 3.1 Flash LiteModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.49sTimp de răspuns (maxim)4.96sTimp de răspuns (total)8.98sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.49sTimp de răspuns (mediu)…
279Tokenuri de ieșire…
7,351Tokenuri de raționament…
Qwen3.6 Plus PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)14.95sTimp de răspuns (maxim)15.40sTimp de răspuns (total)29.90sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
14.95sTimp de răspuns (mediu)…
270Tokenuri de ieșire…
10,706Tokenuri de raționament…
Specific domeniului
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Gemini 3.1 Flash LiteModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.6Scor mediu pe toate testele de benchmark.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)139.90sTimp de răspuns (maxim)141.40sTimp de răspuns (total)419.69sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
139.90sTimp de răspuns (mediu)…
18Tokenuri de ieșire…
566,210Tokenuri de raționament…
Qwen3.6 Plus PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)22.08sTimp de răspuns (maxim)43.55sTimp de răspuns (total)66.23sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
22.08sTimp de răspuns (mediu)…
49Tokenuri de ieșire…
26,895Tokenuri de raționament…
Inteligență generală
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Gemini 3.1 Flash LiteModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
5.0Scor mediu pe toate testele de benchmark.…
2.1Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)45.69sTimp de răspuns (maxim)45.69sTimp de răspuns (total)45.69sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
45.69sTimp de răspuns (mediu)…
95Tokenuri de ieșire…
64,644Tokenuri de raționament…
Qwen3.6 Plus PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
0.0Scor mediu pe toate testele de benchmark.…
0.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)0msTimp de răspuns (maxim)0msTimp de răspuns (total)0msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
0msTimp de răspuns (mediu)…
0Tokenuri de ieșire…
0Tokenuri de raționament…
Respectarea instrucțiunilor
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Gemini 3.1 Flash LiteModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
7.3Scor mediu pe toate testele de benchmark.…
5.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
83.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)23.26sTimp de răspuns (maxim)43.87sTimp de răspuns (total)46.51sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
23.26sTimp de răspuns (mediu)…
52Tokenuri de ieșire…
3,549Tokenuri de raționament…
Qwen3.6 Plus PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.40sTimp de răspuns (maxim)3.40sTimp de răspuns (total)3.40sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.40sTimp de răspuns (mediu)…
27Tokenuri de ieșire…
1,383Tokenuri de raționament…
Rezolvare de puzzle-uri
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Gemini 3.1 Flash LiteModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
5.7Scor mediu pe toate testele de benchmark.…
6.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 2Timp de răspuns (mediu)50.83sTimp de răspuns (maxim)144.85sTimp de răspuns (total)152.49sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
50.83sTimp de răspuns (mediu)…
213Tokenuri de ieșire…
193,654Tokenuri de raționament…
Qwen3.6 Plus PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)7.52sTimp de răspuns (maxim)7.52sTimp de răspuns (total)7.52sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.52sTimp de răspuns (mediu)…
27Tokenuri de ieșire…
2,998Tokenuri de raționament…
Apelare instrumente
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Gemini 3.1 Flash LiteModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)6.44sTimp de răspuns (maxim)6.44sTimp de răspuns (total)6.44sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
6.44sTimp de răspuns (mediu)…
234Tokenuri de ieșire…
2,601Tokenuri de raționament…
Qwen3.6 Plus PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.87sTimp de răspuns (maxim)5.87sTimp de răspuns (total)5.87sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.87sTimp de răspuns (mediu)…
267Tokenuri de ieșire…
1,330Tokenuri de raționament…
Cultură generală
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de ieșire
Tokenuri de raționament
Gemini 3.1 Flash LiteModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
-
-
-
-
-
-
-
-
Qwen3.6 Plus PreviewModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
0.0Scor mediu pe toate testele de benchmark.…
0.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)0msTimp de răspuns (maxim)0msTimp de răspuns (total)0msUn test este considerat trecut complet doar dacă toate rulările lui trec.…