Navigare
AI BENCHY
Compară Grafice
❤️ Made by XCS
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Anthropic: Claude Sonnet 4.6 vs Inception: Mercury 2

Compară:

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-03-05

Metrică Anthropic: Claude Sonnet 4.6 none Lansare: 2026-02-17 Inception: Mercury 2 medium Lansare: 2026-02-24
Rang #25 #35
Scor mediu 6.9 5.4
Teste corecte
Consistență 10.0 8.3
Cost per rezultat 2.460 0.622
Cost total $0.246 $0.044
Rată de trecere pe încercare 66.7% 57.8%
Teste instabile 0 3
common.totalAttempts 45 (15 x 3) 45 (15 x 3)
Tokenuri de ieșire 6,703 3,571
Tokenuri de raționament 0 45,379
Timp de răspuns (medie) 5.94s 2.47s
Timp de răspuns (maxim) 23.84s 14.63s
Timp de răspuns (total) 47.55s 34.56s

Top modele după scor

Timp de răspuns (medie)

Scor vs cost total

Scor mediu vs Timp de răspuns (medie)

Defalcare pe categorii

Trucuri anti-AI Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (medie) Tokenuri de ieșire Tokenuri de raționament
Anthropic: Claude Sonnet 4.6 4.0 10.0 33.3% 0 4.83s 1,199 0
Inception: Mercury 2 7.3 9.8 66.7% 0 1.30s 2,531 2,410
Combinat Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (medie) Tokenuri de ieșire Tokenuri de raționament
Anthropic: Claude Sonnet 4.6 9.0 10.0 100.0% 0 23.84s 3,766 0
Inception: Mercury 2 10.0 10.0 100.0% 0 3.28s 268 4,887
Parsare și extragere de date Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (medie) Tokenuri de ieșire Tokenuri de raționament
Anthropic: Claude Sonnet 4.6 9.9 10.0 100.0% 0 3.43s 252 0
Inception: Mercury 2 5.5 5.9 83.3% 1 1.11s 183 1,656
Specific domeniului Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (medie) Tokenuri de ieșire Tokenuri de raționament
Anthropic: Claude Sonnet 4.6 7.0 10.0 66.7% 0 3.54s 413 0
Inception: Mercury 2 10.0 7.2 11.1% 1 6.48s 41 30,754
Respectarea instrucțiunilor Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (medie) Tokenuri de ieșire Tokenuri de raționament
Anthropic: Claude Sonnet 4.6 5.5 10.0 50.0% 0 1.96s 90 0
Inception: Mercury 2 10.0 10.0 100.0% 0 1.07s 14 958
Puzzle Solving Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (medie) Tokenuri de ieșire Tokenuri de raționament
Anthropic: Claude Sonnet 4.6 7.0 10.0 66.7% 0 2.92s 536 0
Inception: Mercury 2 1.7 7.5 22.2% 1 934ms 354 2,758
Apelare instrumente Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (medie) Tokenuri de ieșire Tokenuri de raționament
Anthropic: Claude Sonnet 4.6 10.0 10.0 100.0% 0 4.11s 447 0
Inception: Mercury 2 10.0 10.0 100.0% 0 1.89s 180 1,956

Comparație rapidă

Schimbă perechea de comparație