AI BENCHY Compare

Modele comparate

Rezumat

Comparație benchmark Qwen3.7 Max vs Qwen3.7 Plus vs Claude Opus 4.7Qwen3.7 Max conduce la Scor cu 9.4. Qwen3.7 Max conduce la Fiabilitate cu 10.0. Qwen3.7 Plus are cel mai mic Cost total, $0.177. Claude Opus 4.7 are cel mai rapid timp de răspuns, 4.73s.

Model recomandat: Claude Opus 4.7 - Scorul rămâne aproape de cel mai bun scor de aici (8.7 vs 9.4) și răspunde de aproximativ 5.8x mai rapid decât celelalte modele din această comparație.

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-06-12

Metrică	Qwen3.7 Max Qwen3.7 Max medium Lansare: 2026-05-22	Qwen3.7 Plus Qwen3.7 Plus medium Lansare: 2026-06-03	Claude Opus 4.7 Claude Opus 4.7 medium Lansare: 2026-04-16

Metrică	Qwen3.7 Max Qwen3.7 Max medium Lansare: 2026-05-22	Qwen3.7 Plus Qwen3.7 Plus medium Lansare: 2026-06-03	Claude Opus 4.7 Claude Opus 4.7 medium Lansare: 2026-04-16
Scor	9.4	8.2	8.7
Rang	#4	#28	#17
Fiabilitate	10.0	10.0	10.0
Consistență	9.6	9.1	9.6
Teste corecte
Rată de trecere pe încercare	88.9%	77.8%	82.5%
Teste instabile	1	2	1
Rulări totale	63	63	63
Cost per rezultat	5.517	1.474	3.991
Cost total	$0.523	$0.177	$0.679
Preț de intrare	$1.250 / 1M	$0.320 / 1M	$5.000 / 1M
Preț de ieșire	$3.750 / 1M	$1.280 / 1M	$25.000 / 1M
Total tokenuri de intrare	42,360	40,939	65,406
Tokenuri de ieșire	2,129	2,125	11,858
Tokenuri de raționament	122,959	125,754	2,198
Timp de răspuns (mediu)	16.02s	38.95s	4.73s
Timp de răspuns (maxim)	59.98s	178.04s	23.18s
Timp de răspuns (total)	336.51s	817.85s	94.51s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#4 Qwen3.7 Max

medium

Cost: $0.017
Time: 68.8s
Tokens: 4,526 tok

#28 Qwen3.7 Plus

medium

Cost: $0.018
Time: 193.2s
Tokens: 10,821 tok

#17 Claude Opus 4.7

medium

Cost: $0.059
Time: 26.8s
Tokens: 2,475 tok

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	10.0	10.0	100.0%	6.36s	672	222	8,742
Qwen3.7 Plus	10.0	10.0	100.0%	8.58s	672	195	5,065
Claude Opus 4.7	8.3	10.0	75.0%	1.85s	894	348	0

Programare	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	10.0	10.0	100.0%	0	35.31s	7,893	423	34,808
Qwen3.7 Plus	6.1	6.6	55.6%	1	108.60s	6,472	414	43,576
Claude Opus 4.7	7.6	7.2	77.8%	1	12.96s	10,635	7,629	1,114

Combinat	Scor	Consistență	Rată de trecere pe încercare	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	10.0	10.0	100.0%	19.60s	14,934	366	8,405
Qwen3.7 Plus	10.0	10.0	100.0%	65.24s	14,934	366	10,132
Claude Opus 4.7	10.0	10.0	100.0%	21.45s	24,501	2,369	1,084

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	10.0	10.0	100.0%	8.80s	7,782	270	6,254
Qwen3.7 Plus	10.0	10.0	100.0%	21.75s	7,782	270	6,713
Claude Opus 4.7	10.0	10.0	100.0%	2.37s	10,533	324	0

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	5.9	7.2	55.6%	1	24.94s	771	61	31,793
Qwen3.7 Plus	3.6	7.2	22.2%	1	45.35s	771	57	27,073
Claude Opus 4.7	7.7	10.0	66.7%	0	1.17s	630	51	0

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	10.0	10.0	100.0%	11.70s	516	135	4,457
Qwen3.7 Plus	10.0	10.0	100.0%	25.48s	516	123	3,998
Claude Opus 4.7	10.0	10.0	100.0%	2.87s	723	256	0

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	10.0	10.0	100.0%	7.46s	699	102	5,452
Qwen3.7 Plus	10.0	10.0	100.0%	16.13s	699	102	5,013
Claude Opus 4.7	10.0	10.0	100.0%	1.57s	939	114	0

Rezolvare de puzzle-uri	Scor	Consistență	Rată de trecere pe încercare	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	10.0	10.0	100.0%	8.84s	696	259	8,908
Qwen3.7 Plus	10.0	10.0	100.0%	16.38s	696	280	7,312
Claude Opus 4.7	10.0	10.0	100.0%	2.43s	939	370	0

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	10.0	10.0	100.0%	6.63s	8,193	267	1,220
Qwen3.7 Plus	10.0	10.0	100.0%	15.02s	8,193	292	1,831
Claude Opus 4.7	10.0	10.0	100.0%	4.17s	15,339	373	0

Cultură generală	Scor	Consistență	Rată de trecere pe încercare	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Qwen3.7 Max	3.0	10.0	0.0%	33.37s	204	24	12,920
Qwen3.7 Plus	3.0	10.0	0.0%	91.07s	204	26	15,041
Claude Opus 4.7	3.0	10.0	0.0%	2.25s	273	24	0

Comparație rapidă

Schimbă perechea de comparație

GPT-5.5lowvsQwen3.7 Maxmedium DeepSeek V4 FlashhighvsQwen3.7 Plusmedium Gemini 3.5 FlashlowvsQwen3.7 Maxmedium Claude Opus 4.7mediumvsGPT-5.2 Chatnone GPT-5.2 ChatnonevsQwen3.7 Plusmedium Claude Opus 4.7mediumvsDeepSeek V4 Flashhigh Gemini 3.5 FlashhighvsQwen3.7 Maxmedium Qwen3.7 PlusmediumvsStep 3.7 Flashlow Claude Opus 4.7mediumvsGemini 3.5 Flashlow Claude Opus 4.7mediumvsGPT-5.5low GPT-5.3 ChatnonevsQwen3.7 Plusmedium Gemini 3 Flash PreviewlowvsQwen3.7 Plusmedium