Comparație benchmark Claude Opus 4.7 vs Gemma 4 31B: Claude Opus 4.7 conduce la scorul mediu cu 7.4 vs 6.3. Gemma 4 31B are costul de benchmark mai mic, $0.033 vs $0.505. Claude Opus 4.7 este mai rapid cu 3.02s vs 56.55s, cu rate de reușită de 76.2% vs 69.8%.
Model recomandat: Claude Opus 4.7 - Are cel mai bun scor aici (7.4) și răspunde de aproximativ 18.7x mai rapid decât Gemma 4 31B.
Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-06-18
Metrică
Claude Opus 4.7Claude Opus 4.7noneModel arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.Lansare: 2026-04-16
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
10.0Scorul de succes la prima încercare: 10.0 înseamnă fără erori reîncercabile ale API-ului țintă sau de limită de rată înainte de apeluri reușite; erorile urmărite reduc scorul.…
Consistență
9.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
9.4Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
Teste corecte
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 3Timp de răspuns (mediu)3.02sTimp de răspuns (maxim)18.27sTimp de răspuns (total)57.44sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 2Timp expirat: 2Răspuns greșit: 2Fără răspuns: 1Timp de răspuns (mediu)56.55sTimp de răspuns (maxim)437.40sTimp de răspuns (total)1074.41sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
Rată de trecere pe încercare
76.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
69.8%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
Teste instabile
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Rulări totale
57Rulări totale…
63Rulări totale…
Cost per rezultat
3.154Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
0.257Afișează costul mediu pe răspuns corect în benchmark, în cenți (mai mic este mai bun).…
Cost total
$0.505Cost total (preț curent)…
$0.033Cost total (preț curent)…
Preț de intrare
$5.000 / 1MPreț de intrare…
$0.120 / 1MPreț de intrare…
Preț de ieșire
$25.000 / 1MPreț de ieșire…
$0.350 / 1MPreț de ieșire…
Total tokenuri de intrare
69,576Total tokenuri de intrare…
17,957Total tokenuri de intrare…
Tokenuri de ieșire
6,265Tokenuri de ieșire…
22,356Tokenuri de ieșire…
Tokenuri de raționament
0Tokenuri de raționament…
65,726Tokenuri de raționament…
Timp de răspuns (mediu)
3.02sTimp de răspuns (mediu)…
56.55sTimp de răspuns (mediu)…
Timp de răspuns (maxim)
18.27sTimp de răspuns (maxim)…
437.40sTimp de răspuns (maxim)…
Timp de răspuns (total)
57.44sTimp de răspuns (total)…
1074.41sTimp de răspuns (total)…
Prezentare generare
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#49 Claude Opus 4.7
none
Cost
$0.051
Timp
24.2s
Tokenuri
2,181 tok
#88 Gemma 4 31B
medium
Cost
$0.002
Timp
45.7s
Tokenuri
2,696 tok
Scor
-
Cost
-
Timp
-
Tokenuri
-
Top modele după scor
Scor vs cost total
Timp de răspuns (mediu)
Scor vs Timp de răspuns (mediu)
Total tokenuri de ieșire
Scor vs Total tokenuri de ieșire
Defalcare pe categorii
Trucuri anti-AI
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Claude Opus 4.7Model arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
8.3Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
75.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)2.12sTimp de răspuns (maxim)3.75sTimp de răspuns (total)8.50sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)12.89sTimp de răspuns (maxim)26.66sTimp de răspuns (total)51.55sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
12.89sTimp de răspuns (mediu)…
816Total tokenuri de intrare…
962Tokenuri de ieșire…
2,046Tokenuri de raționament…
Programare
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Claude Opus 4.7Model arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.3Scor mediu pe toate testele de benchmark.…
3.3Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
33.3%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.84sTimp de răspuns (maxim)2.84sTimp de răspuns (total)2.84sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
5.8Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
22.2%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
1Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Timp expirat: 2Fără răspuns: 1Timp de răspuns (mediu)219.76sTimp de răspuns (maxim)437.40sTimp de răspuns (total)659.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
219.76sTimp de răspuns (mediu)…
5,568Total tokenuri de intrare…
11,098Tokenuri de ieșire…
33,212Tokenuri de raționament…
Combinat
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Claude Opus 4.7Model arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
9.5Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)18.27sTimp de răspuns (maxim)18.27sTimp de răspuns (total)18.27sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (mediu)0msTimp de răspuns (maxim)0msTimp de răspuns (total)0msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
0msTimp de răspuns (mediu)…
0Total tokenuri de intrare…
0Tokenuri de ieșire…
0Tokenuri de raționament…
Parsare și extragere de date
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Claude Opus 4.7Model arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.15sTimp de răspuns (maxim)2.33sTimp de răspuns (total)4.29sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)21.11sTimp de răspuns (maxim)21.94sTimp de răspuns (total)42.21sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
21.11sTimp de răspuns (mediu)…
8,334Total tokenuri de intrare…
1,822Tokenuri de ieșire…
2,951Tokenuri de raționament…
Specific domeniului
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Claude Opus 4.7Model arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
7.7Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)1.19sTimp de răspuns (maxim)1.40sTimp de răspuns (total)3.58sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
66.7%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)38.48sTimp de răspuns (maxim)68.92sTimp de răspuns (total)115.43sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
38.48sTimp de răspuns (mediu)…
876Total tokenuri de intrare…
4,349Tokenuri de ieșire…
8,985Tokenuri de raționament…
Inteligență generală
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Claude Opus 4.7Model arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)3.47sTimp de răspuns (maxim)3.47sTimp de răspuns (total)3.47sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)9.57sTimp de răspuns (maxim)9.57sTimp de răspuns (total)9.57sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
9.57sTimp de răspuns (mediu)…
567Total tokenuri de intrare…
105Tokenuri de ieșire…
888Tokenuri de raționament…
Respectarea instrucțiunilor
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Claude Opus 4.7Model arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)1.46sTimp de răspuns (maxim)1.68sTimp de răspuns (total)2.91sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)12.76sTimp de răspuns (maxim)17.53sTimp de răspuns (total)25.52sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
12.76sTimp de răspuns (mediu)…
777Total tokenuri de intrare…
533Tokenuri de ieșire…
2,035Tokenuri de raționament…
Rezolvare de puzzle-uri
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Claude Opus 4.7Model arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)2.46sTimp de răspuns (maxim)3.72sTimp de răspuns (total)7.38sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)26.91sTimp de răspuns (maxim)61.08sTimp de răspuns (total)80.72sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
26.91sTimp de răspuns (mediu)…
801Total tokenuri de intrare…
1,795Tokenuri de ieșire…
5,595Tokenuri de raționament…
Apelare instrumente
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Claude Opus 4.7Model arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
10.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
100.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Niciun răspuns eșuat.Timp de răspuns (mediu)4.74sTimp de răspuns (maxim)4.74sTimp de răspuns (total)4.74sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Eroare API: 1Timp de răspuns (mediu)0msTimp de răspuns (maxim)0msTimp de răspuns (total)0msUn test este considerat trecut complet doar dacă toate rulările lui trec.…
0msTimp de răspuns (mediu)…
0Total tokenuri de intrare…
0Tokenuri de ieșire…
0Tokenuri de raționament…
Cultură generală
Scor
Consistență
Rată de trecere pe încercare
Teste instabile
Teste corecte
Timp de răspuns (mediu)
Tokenuri de intrare
Tokenuri de ieșire
Tokenuri de raționament
Claude Opus 4.7Model arhivat: acest model nu mai este actualizat și nu mai este testat pe teste noi.
3.0Scor mediu pe toate testele de benchmark.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)1.46sTimp de răspuns (maxim)1.46sTimp de răspuns (total)1.46sUn test este considerat trecut complet doar dacă toate rulările lui trec.…
10.0Scorul de consistență reflectă stabilitatea între rulări (10 = foarte consistent, chiar dacă este constant greșit).…
0.0%Rata de trecere pe încercare = încercări trecute / total încercări pe toate rulările.…
0Testele instabile au avut rezultate mixte între rulări (cel puțin un succes și un eșec).…
Un test este considerat trecut complet doar dacă toate rulările lui trec.Răspuns greșit: 1Timp de răspuns (mediu)90.14sTimp de răspuns (maxim)90.14sTimp de răspuns (total)90.14sUn test este considerat trecut complet doar dacă toate rulările lui trec.…