Navigare
AI BENCHY
Advertise here

AI BENCHY Compare

Inception: Mercury 2 vs xAI: Grok 4.3

Rezumat

Comparație benchmark Mercury 2 vs Grok 4.3: Grok 4.3 conduce la scorul mediu cu 7.7 vs 7.5. Mercury 2 are costul de benchmark mai mic, $0.058 vs $0.614. Mercury 2 este mai rapid cu 2.24s vs 47.51s, cu rate de reușită de 54.0% vs 71.4%.

Model recomandat: Mercury 2 - Scorul rămâne aproape de cel mai bun scor de aici (7.5 vs 7.7) și costă de aproximativ 10.6x mai puțin decât Grok 4.3.

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-06-18

Metrică Mercury 2 Mercury 2 medium Lansare: 2026-02-24 Grok 4.3 Grok 4.3 medium Lansare: 2026-05-01
Scor 7.5 7.7
Rang #44 #37
Fiabilitate 10.0 10.0
Consistență 8.8 8.5
Teste corecte
Rată de trecere pe încercare 54.0% 71.4%
Teste instabile 3 4
Rulări totale 63 63
Cost per rezultat 0.578 4.724
Cost total $0.058 $0.614
Preț de intrare $0.250 / 1M $1.250 / 1M
Preț de ieșire $0.750 / 1M $2.500 / 1M
Total tokenuri de intrare 35,116 44,472
Tokenuri de ieșire 4,048 1,981
Tokenuri de raționament 61,219 221,382
Timp de răspuns (mediu) 2.24s 47.51s
Timp de răspuns (maxim) 14.63s 216.69s
Timp de răspuns (total) 44.72s 997.68s

Prezentare generare

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#44 Mercury 2

medium
Cost
$0.002
Timp
2.1s
Tokenuri
1,702 tok

#37 xAI: Grok 4.3

medium
Cost
$0.009
Timp
19.0s
Tokenuri
3,661 tok

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 6.9 9.9 50.0% 0 1.12s 554 2,546 2,609
Grok 4.3 10.0 10.0 100.0% 0 8.83s 2,010 88 8,207
Programare Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
Grok 4.3 5.9 7.7 44.4% 1 41.23s 8,340 1,028 31,226
Combinat Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 10.0 10.0 100.0% 0 3.28s 12,909 268 4,887
Grok 4.3 10.0 10.0 100.0% 0 63.99s 12,909 234 15,301
Parsare și extragere de date Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 7.3 5.9 83.3% 1 1.11s 6,234 183 1,656
Grok 4.3 10.0 10.0 100.0% 0 18.97s 7,761 180 9,546
Specific domeniului Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 2.9 7.2 11.1% 1 6.48s 695 41 30,754
Grok 4.3 5.3 7.2 44.4% 1 181.74s 1,764 14 111,300
Inteligență generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 4.8 10.0 0.0% 0 821ms 456 137 542
Grok 4.3 5.4 2.5 66.7% 1 24.70s 825 70 5,020
Respectarea instrucțiunilor Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 10.0 10.0 100.0% 0 1.07s 340 14 958
Grok 4.3 9.8 10.0 100.0% 0 18.58s 1,362 57 8,713
Rezolvare de puzzle-uri Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 5.4 10.0 33.3% 0 949ms 601 361 2,781
Grok 4.3 5.9 7.2 55.6% 1 22.52s 1,689 128 14,468
Apelare instrumente Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 10.0 10.0 100.0% 0 1.89s 6,080 180 1,956
Grok 4.3 10.0 10.0 100.0% 0 17.66s 7,263 168 4,615
Cultură generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 3.0 10.0 0.0% 0 2.58s 182 22 3,748
Grok 4.3 3.0 10.0 0.0% 0 44.47s 549 14 12,986

Comparație rapidă

Schimbă perechea de comparație