Navigare
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Inception: Mercury 2 vs Mistral: Mistral Small 4

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-06-03

Metrică Mercury 2 Mercury 2 none Lansare: 2026-02-24 Mistral Small 4 Mistral Small 4 medium Lansare: 2026-03-16
Scor 4.6 5.4
Rang #153 #129
Fiabilitate 10.0 10.0
Consistență 9.1 7.1
Teste corecte
Rată de trecere pe încercare 25.0% 45.0%
Teste instabile 2 7
Rulări totale 60 60
Cost per rezultat 0.216 1.112
Cost total $0.009 $0.056
Preț de intrare $0.250 / 1M $0.150 / 1M
Preț de ieșire $0.750 / 1M $0.600 / 1M
Total tokenuri de intrare 25,515 39,834
Tokenuri de ieșire 3,001 21,871
Tokenuri de raționament 0 68,349
Timp de răspuns (mediu) 614ms 8.35s
Timp de răspuns (maxim) 1.27s 59.15s
Timp de răspuns (total) 12.28s 167.08s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 3.0 10.0 0.0% 0 483ms 631 286 0
Mistral Small 4 5.6 3.8 66.7% 3 2.67s 708 4,055 4,778
Programare Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 3.5 9.4 0.0% 0 831ms 4,631 1,650 0
Mistral Small 4 5.1 6.8 33.3% 1 44.82s 4,894 9,322 38,386
Combinat Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 3.0 10.0 0.0% 0 606ms 4,821 131 0
Mistral Small 4 3.0 10.0 0.0% 0 25.25s 18,706 2,612 10,700
Parsare și extragere de date Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 7.3 5.9 83.3% 1 667ms 6,362 180 0
Mistral Small 4 7.3 5.9 83.3% 1 1.23s 6,171 335 723
Specific domeniului Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 5.3 7.2 44.4% 1 534ms 784 46 0
Mistral Small 4 5.3 7.2 44.4% 1 6.11s 742 2,621 6,904
Inteligență generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 4.8 10.0 0.0% 0 628ms 495 159 0
Mistral Small 4 4.8 10.0 0.0% 0 2.05s 519 821 828
Respectarea instrucțiunilor Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 6.5 10.0 50.0% 0 551ms 691 82 0
Mistral Small 4 7.3 5.8 83.3% 1 1.38s 729 540 1,031
Rezolvare de puzzle-uri Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 3.1 10.0 0.0% 0 535ms 694 251 0
Mistral Small 4 3.4 9.7 0.0% 0 2.17s 735 1,226 2,632
Apelare instrumente Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 10.0 10.0 100.0% 0 1.27s 6,193 197 0
Mistral Small 4 10.0 10.0 100.0% 0 3.50s 6,420 321 810
Cultură generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 3.0 10.0 0.0% 0 548ms 213 19 0
Mistral Small 4 3.0 10.0 0.0% 0 5.92s 210 18 1,557

Comparație rapidă

Schimbă perechea de comparație