DeepSeek: DeepSeek V4 Pro vs MoonshotAI: Kimi K2.5
Rezumat
Comparație benchmark DeepSeek V4 Pro vs Kimi K2.5: DeepSeek V4 Pro conduce la scorul mediu cu 7.6 vs 7.5. DeepSeek V4 Pro are costul de benchmark mai mic, $0.157 vs $0.348. DeepSeek V4 Pro este mai rapid cu 77.20s vs 98.43s, cu rate de reușită de 66.7% vs 68.3%.
Model recomandat: DeepSeek V4 Pro - Are cel mai bun scor aici (7.6) și costă de aproximativ 2.2x mai puțin decât Kimi K2.5.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-06-17
9.3Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
7.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
6.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 5Nu a urmat instrucțiunile: 2Fără răspuns: 2Timp expirat: 2Timp de răspuns (mediu)98.43sTimp de răspuns (maxim)281.00sTimp de răspuns (total)1378.03sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
68.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
8Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
8Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
63Rulări totale…
63Rulări totale…
Cost per rezultat
1.742Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
3.704Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.157Cost total (preț curent)…
$0.348Cost total (preț curent)…
Preț de intrare
$0.435 / 1MPreț de intrare…
$0.375 / 1MPreț de intrare…
Preț de ieșire
$0.870 / 1MPreț de ieșire…
$2.025 / 1MPreț de ieșire…
Total tokenuri de intrare
38,726Total tokenuri de intrare…
34,312Total tokenuri de intrare…
Tokenuri de ieșire
6,334Tokenuri de ieșire…
48,379Tokenuri de ieșire…
Tokenuri de raționament
159,151Tokenuri de raționament…
157,747Tokenuri de raționament…
Timp de răspuns (mediu)
77.20sTimp de răspuns (mediu)…
98.43sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
416.76sTimp de răspuns (maxim)…
281.00sTimp de răspuns (maxim)…
Timp de răspuns (total)
1621.17sTimp de răspuns (total)…
1378.03sTimp de răspuns (total)…
Generation showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
5.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
58.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Fără răspuns: 1Timp de răspuns (mediu)25.70sTimp de răspuns (maxim)48.19sTimp de răspuns (total)102.80sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
83.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Răspuns greșit: 1Timp de răspuns (mediu)51.38sTimp de răspuns (maxim)85.28sTimp de răspuns (total)102.75sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp expirat: 1Timp de răspuns (mediu)243.00sTimp de răspuns (maxim)416.76sTimp de răspuns (total)729.00sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Fără răspuns: 1Timp expirat: 1Timp de răspuns (mediu)217.49sTimp de răspuns (maxim)281.00sTimp de răspuns (total)652.48sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)38.17sTimp de răspuns (maxim)38.17sTimp de răspuns (total)38.17sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)71.37sTimp de răspuns (maxim)71.37sTimp de răspuns (total)71.37sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)25.03sTimp de răspuns (maxim)27.49sTimp de răspuns (total)50.06sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)49.78sTimp de răspuns (maxim)49.78sTimp de răspuns (total)49.78sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.2Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Formatare suplimentară: 1Timp de răspuns (mediu)151.46sTimp de răspuns (maxim)387.23sTimp de răspuns (total)454.38sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 2Timp expirat: 1Timp de răspuns (mediu)137.29sTimp de răspuns (maxim)137.29sTimp de răspuns (total)137.29sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)8.83sTimp de răspuns (maxim)8.83sTimp de răspuns (total)8.83sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
3.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)69.73sTimp de răspuns (maxim)69.73sTimp de răspuns (total)69.73sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
6.6Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
83.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Timp de răspuns (mediu)8.73sTimp de răspuns (maxim)9.53sTimp de răspuns (total)17.45sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)92.47sTimp de răspuns (maxim)92.47sTimp de răspuns (total)92.47sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
4.9Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
77.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
2Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)56.85sTimp de răspuns (maxim)146.68sTimp de răspuns (total)170.55sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
7.3Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
44.4%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Nu a urmat instrucțiunile: 1Răspuns greșit: 1Timp de răspuns (mediu)43.23sTimp de răspuns (maxim)82.75sTimp de răspuns (total)86.47sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)15.92sTimp de răspuns (maxim)15.92sTimp de răspuns (total)15.92sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)31.74sTimp de răspuns (maxim)31.74sTimp de răspuns (total)31.74sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)34.01sTimp de răspuns (maxim)34.01sTimp de răspuns (total)34.01sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)83.95sTimp de răspuns (maxim)83.95sTimp de răspuns (total)83.95sUn test este considerat trecut complet doar dacă toate rulările lui trec.…