DeepSeek V4 Flash 0731 (high) vs Qwen3.8 27B (low)
DeepSeek V4 Flash 0731 (high) conduce la scorul mediu cu 8.0 vs 7.9. Qwen3.8 27B (low) are costul de benchmark mai mic, ~$0.071 vs $0.134. Qwen3.8 27B (low) este mai rapid cu 39.11s vs 114.94s, cu rate de reușită de 75.8% vs 68.2%.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la:
2026-08-20
Rang
#54
Total tokenuri de ieșire
513,307
Timp de răspuns (mediu)
114.94s
Cost total
$0.134
Răspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Rang
#61
Total tokenuri de ieșire
169,329
Timp de răspuns (mediu)
39.11s
Cost total
~$0.071Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
Model recomandatQwen3.8 27B (low)
Scorul rămâne aproape de cel mai bun scor de aici (7.9 vs 8.0) și costă de aproximativ 1.9x mai puțin decât DeepSeek V4 Flash 0731 (high).
Qwen3.8 27BQwen3.8 27BlowRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14
Qwen3.8 27BQwen3.8 27BlowRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.Lansare: 2026-08-14
Scor
8.0Scor mediu pe toate testele de benchmark.…
7.9Scor mediu pe toate testele de benchmark.…
Rang
#54
#61
Fiabilitate
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
8.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Încercări
66/66
66/66
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 4Nu a urmat instrucțiunile: 2Eroare API: 1Fără răspuns: 1Timp de răspuns (mediu)114.94sTimp de răspuns (maxim)600.61sTimp de răspuns (total)2528.65sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 4Fără răspuns: 2Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)39.11sTimp de răspuns (maxim)376.04sTimp de răspuns (total)860.51sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
75.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
68.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
5Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
66Rulări totale…
66Rulări totale…
Cost per rezultat
0.956
~0.473Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
Cost total
$0.134
~$0.071Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.7171 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.070898.
Preț de intrare
$0.140 / 1MPreț de intrare…
N/DPreț de intrare…
Preț de ieșire
$0.280 / 1MPreț de ieșire…
N/DPreț de ieșire…
Total tokenuri de intrare
96,702Total tokenuri de intrare…
99,705Total tokenuri de intrare…
Tokenuri de ieșire
16,966Tokenuri de ieșire…
1,545Tokenuri de ieșire…
Tokenuri de raționament
496,341Tokenuri de raționament…
167,784Tokenuri de raționament…
Timp de răspuns (mediu)
114.94sTimp de răspuns (mediu)…
39.11sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
600.61sTimp de răspuns (maxim)…
376.04sTimp de răspuns (maxim)…
Timp de răspuns (total)
2528.65sTimp de răspuns (total)…
860.51sTimp de răspuns (total)…
Parametri
284B în total (13B activi)
27.3B
Disponibilitate
Închis
Ponderi disponibile
Prezentare generare modele
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#54 DeepSeek V4 Flash 0731
high
SVG invalid
Cost
$0.000
Timp
187.3s
Tokenuri
19,048 tok
#61 Qwen3.8 27B
lowRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
Cost
~$0.003Estimarea include numai energia electrică a plăcii GPU. Restul computerului și achiziția hardware-ului nu sunt incluse. NVIDIA GeForce RTX 3090: 0.0258 h × 0.300 kW × €0.2896/kWh × 1.138 USD/EUR = ~$0.000000.
7.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
91.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)13.62sTimp de răspuns (maxim)39.34sTimp de răspuns (total)54.50sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
13.62sTimp de răspuns (mediu)…
1,488Total tokenuri de intrare…
542Tokenuri de ieșire…
10,576Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.02sTimp de răspuns (maxim)5.68sTimp de răspuns (total)12.07sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
6.3Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
55.6%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)252.67sTimp de răspuns (maxim)396.09sTimp de răspuns (total)758.02sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
252.67sTimp de răspuns (mediu)…
7,044Total tokenuri de intrare…
2,160Tokenuri de ieșire…
191,210Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
7.7Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)140.92sTimp de răspuns (maxim)376.04sTimp de răspuns (total)422.75sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)87.10sTimp de răspuns (maxim)131.57sTimp de răspuns (total)174.19sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
87.10sTimp de răspuns (mediu)…
67,283Total tokenuri de intrare…
11,903Tokenuri de ieșire…
41,397Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)90.63sTimp de răspuns (maxim)143.71sTimp de răspuns (total)181.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.65sTimp de răspuns (maxim)4.40sTimp de răspuns (total)7.30sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.65sTimp de răspuns (mediu)…
7,764Total tokenuri de intrare…
336Tokenuri de ieșire…
1,259Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)8.03sTimp de răspuns (maxim)9.09sTimp de răspuns (total)16.06sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Fără răspuns: 1Timp de răspuns (mediu)458.65sTimp de răspuns (maxim)600.61sTimp de răspuns (total)1375.95sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
458.65sTimp de răspuns (mediu)…
700Total tokenuri de intrare…
104Tokenuri de ieșire…
215,629Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp de răspuns (mediu)60.78sTimp de răspuns (maxim)120.94sTimp de răspuns (total)182.34sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.64sTimp de răspuns (maxim)5.64sTimp de răspuns (total)5.64sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.64sTimp de răspuns (mediu)…
708Total tokenuri de intrare…
72Tokenuri de ieșire…
533Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
5.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)5.37sTimp de răspuns (maxim)5.37sTimp de răspuns (total)5.37sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.46sTimp de răspuns (maxim)4.55sTimp de răspuns (total)8.91sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.46sTimp de răspuns (mediu)…
1,101Total tokenuri de intrare…
119Tokenuri de ieșire…
939Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.43sTimp de răspuns (maxim)2.87sTimp de răspuns (total)4.86sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.7Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
77.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)9.36sTimp de răspuns (maxim)12.00sTimp de răspuns (total)28.09sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
9.36sTimp de răspuns (mediu)…
1,305Total tokenuri de intrare…
397Tokenuri de ieșire…
6,801Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
7.7Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)4.91sTimp de răspuns (maxim)8.81sTimp de răspuns (total)14.74sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)5.42sTimp de răspuns (maxim)5.42sTimp de răspuns (total)5.42sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.42sTimp de răspuns (mediu)…
8,889Total tokenuri de intrare…
357Tokenuri de ieșire…
451Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)8.42sTimp de răspuns (maxim)8.42sTimp de răspuns (total)8.42sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)110.63sTimp de răspuns (maxim)110.63sTimp de răspuns (total)110.63sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
110.63sTimp de răspuns (mediu)…
420Total tokenuri de intrare…
976Tokenuri de ieșire…
27,546Tokenuri de raționament…
Qwen3.8 27BRăspunsurile modelului candidat au fost generate pe hardware local. OpenRouter a fost folosit doar pentru evaluare.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp de răspuns (mediu)12.64sTimp de răspuns (maxim)12.64sTimp de răspuns (total)12.64sUn test este considerat trecut complet doar dacă toate rulările lui trec.…