Navigare
AI BENCHY
Advertise here

AI BENCHY Compare

Modele comparate

Rezumat

Comparație benchmark Qwen3.7 Max vs Qwen3.7 Plus vs Claude Opus 4.7Qwen3.7 Max conduce la Scor cu 9.4. Qwen3.7 Max conduce la Fiabilitate cu 10.0. Qwen3.7 Plus are cel mai mic Cost total, $0.177. Claude Opus 4.7 are cel mai rapid timp de răspuns, 4.73s.

Model recomandat: Claude Opus 4.7 - Scorul rămâne aproape de cel mai bun scor de aici (8.7 vs 9.4) și răspunde de aproximativ 5.8x mai rapid decât celelalte modele din această comparație.

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-06-12

Metrică Qwen3.7 Max Qwen3.7 Max medium Lansare: 2026-05-22 Qwen3.7 Plus Qwen3.7 Plus medium Lansare: 2026-06-03 Claude Opus 4.7 Claude Opus 4.7 medium Lansare: 2026-04-16
Scor 9.4 8.2 8.7
Rang #4 #28 #17
Fiabilitate 10.0 10.0 10.0
Consistență 9.6 9.1 9.6
Teste corecte
Rată de trecere pe încercare 88.9% 77.8% 82.5%
Teste instabile 1 2 1
Rulări totale 63 63 63
Cost per rezultat 5.517 1.474 3.991
Cost total $0.523 $0.177 $0.679
Preț de intrare $1.250 / 1M $0.320 / 1M $5.000 / 1M
Preț de ieșire $3.750 / 1M $1.280 / 1M $25.000 / 1M
Total tokenuri de intrare 42,360 40,939 65,406
Tokenuri de ieșire 2,129 2,125 11,858
Tokenuri de raționament 122,959 125,754 2,198
Timp de răspuns (mediu) 16.02s 38.95s 4.73s
Timp de răspuns (maxim) 59.98s 178.04s 23.18s
Timp de răspuns (total) 336.51s 817.85s 94.51s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#4 Qwen3.7 Max

medium
Cost
$0.017
Time
68.8s
Tokens
4,526 tok

#28 Qwen3.7 Plus

medium
Cost
$0.018
Time
193.2s
Tokens
10,821 tok

#17 Claude Opus 4.7

medium
Cost
$0.059
Time
26.8s
Tokens
2,475 tok

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 10.0 10.0 100.0% 0 6.36s 672 222 8,742
Qwen3.7 Plus 10.0 10.0 100.0% 0 8.58s 672 195 5,065
Claude Opus 4.7 8.3 10.0 75.0% 0 1.85s 894 348 0
Programare Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 10.0 10.0 100.0% 0 35.31s 7,893 423 34,808
Qwen3.7 Plus 6.1 6.6 55.6% 1 108.60s 6,472 414 43,576
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114
Combinat Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 10.0 10.0 100.0% 0 19.60s 14,934 366 8,405
Qwen3.7 Plus 10.0 10.0 100.0% 0 65.24s 14,934 366 10,132
Claude Opus 4.7 10.0 10.0 100.0% 0 21.45s 24,501 2,369 1,084
Parsare și extragere de date Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 10.0 10.0 100.0% 0 8.80s 7,782 270 6,254
Qwen3.7 Plus 10.0 10.0 100.0% 0 21.75s 7,782 270 6,713
Claude Opus 4.7 10.0 10.0 100.0% 0 2.37s 10,533 324 0
Specific domeniului Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 5.9 7.2 55.6% 1 24.94s 771 61 31,793
Qwen3.7 Plus 3.6 7.2 22.2% 1 45.35s 771 57 27,073
Claude Opus 4.7 7.7 10.0 66.7% 0 1.17s 630 51 0
Inteligență generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 10.0 10.0 100.0% 0 11.70s 516 135 4,457
Qwen3.7 Plus 10.0 10.0 100.0% 0 25.48s 516 123 3,998
Claude Opus 4.7 10.0 10.0 100.0% 0 2.87s 723 256 0
Respectarea instrucțiunilor Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 10.0 10.0 100.0% 0 7.46s 699 102 5,452
Qwen3.7 Plus 10.0 10.0 100.0% 0 16.13s 699 102 5,013
Claude Opus 4.7 10.0 10.0 100.0% 0 1.57s 939 114 0
Rezolvare de puzzle-uri Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 10.0 10.0 100.0% 0 8.84s 696 259 8,908
Qwen3.7 Plus 10.0 10.0 100.0% 0 16.38s 696 280 7,312
Claude Opus 4.7 10.0 10.0 100.0% 0 2.43s 939 370 0
Apelare instrumente Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 10.0 10.0 100.0% 0 6.63s 8,193 267 1,220
Qwen3.7 Plus 10.0 10.0 100.0% 0 15.02s 8,193 292 1,831
Claude Opus 4.7 10.0 10.0 100.0% 0 4.17s 15,339 373 0
Cultură generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Qwen3.7 Max 3.0 10.0 0.0% 0 33.37s 204 24 12,920
Qwen3.7 Plus 3.0 10.0 0.0% 0 91.07s 204 26 15,041
Claude Opus 4.7 3.0 10.0 0.0% 0 2.25s 273 24 0

Comparație rapidă

Schimbă perechea de comparație