Navigare
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Anthropic: Claude Sonnet 4.6 vs Google: Gemini 2.5 Flash

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-03-15

Metrică Claude Sonnet 4.6 Claude Sonnet 4.6 medium Lansare: 2026-02-17 Gemini 2.5 Flash Gemini 2.5 Flash medium Lansare: 2025-06-17
Rang #12 #15
Scor 8.3 8.0
Consistență 9.5 9.5
Cost per rezultat 8.525 2.619
Cost total $1.023 $0.288
Teste corecte
Rată de trecere pe încercare 77.1% 72.9%
Teste instabile 1 1
Rulări totale 48 48
Tokenuri de ieșire 35,159 1,370
Tokenuri de raționament 24,687 110,522
Timp de răspuns (mediu) 11.23s 12.35s
Timp de răspuns (maxim) 46.35s 95.48s
Timp de răspuns (total) 89.84s 197.62s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Claude Sonnet 4.6 7.7 10.0 66.7% 0 4.95s 1,031 1,093
Gemini 2.5 Flash 7.8 10.0 66.7% 0 6.98s 249 8,832
Combinat Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Claude Sonnet 4.6 10.0 10.0 100.0% 0 46.35s 5,871 3,962
Gemini 2.5 Flash 10.0 10.0 100.0% 0 28.44s 303 11,922
Parsare și extragere de date Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Claude Sonnet 4.6 10.0 10.0 100.0% 0 13.90s 649 742
Gemini 2.5 Flash 10.0 10.0 100.0% 0 4.06s 279 2,325
Specific domeniului Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Claude Sonnet 4.6 2.9 7.2 11.1% 1 0ms 25,790 16,919
Gemini 2.5 Flash 5.9 7.2 55.6% 1 37.34s 18 80,702
Inteligență generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Claude Sonnet 4.6 10.0 10.0 100.0% 0 4.94s 256 433
Gemini 2.5 Flash 4.8 10.0 0.0% 0 4.86s 92 1,899
Respectarea instrucțiunilor Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Claude Sonnet 4.6 10.0 10.0 100.0% 0 2.61s 318 552
Gemini 2.5 Flash 9.8 10.0 100.0% 0 2.62s 69 1,203
Puzzle Solving Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Claude Sonnet 4.6 10.0 10.0 100.0% 0 4.80s 589 635
Gemini 2.5 Flash 7.7 10.0 66.7% 0 3.94s 126 2,499
Apelare instrumente Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Claude Sonnet 4.6 10.0 10.0 100.0% 0 7.48s 655 351
Gemini 2.5 Flash 10.0 10.0 100.0% 0 6.20s 234 1,140

Comparație rapidă

Schimbă perechea de comparație