Navigare
AI BENCHY
Advertise here

AI BENCHY Compare

Inception: Mercury 2 vs inclusionAI: Ring-2.6-1T

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-06-03

Metrică Mercury 2 Mercury 2 none Lansare: 2026-02-24 Ring-2.6-1T Ring-2.6-1T medium Lansare: 2026-05-10
Scor 4.6 7.0
Rang #153 #74
Fiabilitate 10.0 10.0
Consistență 9.1 8.7
Teste corecte
Rată de trecere pe încercare 25.0% 63.3%
Teste instabile 2 3
Rulări totale 60 60
Cost per rezultat 0.216 0.000
Cost total $0.009 $0.033
Preț de intrare $0.250 / 1M $0.075 / 1M
Preț de ieșire $0.750 / 1M $0.625 / 1M
Total tokenuri de intrare 25,515 35,892
Tokenuri de ieșire 3,001 21,752
Tokenuri de raționament 0 42,754
Timp de răspuns (mediu) 614ms 61.29s
Timp de răspuns (maxim) 1.27s 304.19s
Timp de răspuns (total) 12.28s 1164.50s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 3.0 10.0 0.0% 0 483ms 631 286 0
Ring-2.6-1T 10.0 10.0 100.0% 0 42.21s 810 3,833 4,891
Programare Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 3.5 9.4 0.0% 0 831ms 4,631 1,650 0
Ring-2.6-1T 6.5 10.0 50.0% 0 59.65s 834 1,369 3,985
Combinat Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 3.0 10.0 0.0% 0 606ms 4,821 131 0
Ring-2.6-1T 10.0 10.0 100.0% 0 304.19s 14,823 324 6,088
Parsare și extragere de date Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 7.3 5.9 83.3% 1 667ms 6,362 180 0
Ring-2.6-1T 6.5 10.0 50.0% 0 37.36s 8,046 840 1,937
Specific domeniului Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 5.3 7.2 44.4% 1 534ms 784 46 0
Ring-2.6-1T 3.5 4.4 33.3% 2 64.92s 873 9,744 15,013
Inteligență generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 4.8 10.0 0.0% 0 628ms 495 159 0
Ring-2.6-1T 4.1 10.0 0.0% 0 58.26s 561 150 583
Respectarea instrucțiunilor Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 6.5 10.0 50.0% 0 551ms 691 82 0
Ring-2.6-1T 9.8 10.0 100.0% 0 11.78s 774 266 1,831
Rezolvare de puzzle-uri Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 3.1 10.0 0.0% 0 535ms 694 251 0
Ring-2.6-1T 5.9 7.2 55.6% 1 20.73s 792 697 2,479
Apelare instrumente Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 10.0 10.0 100.0% 0 1.27s 6,193 197 0
Ring-2.6-1T 10.0 10.0 100.0% 0 104.44s 8,136 234 1,531
Cultură generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Mercury 2 3.0 10.0 0.0% 0 548ms 213 19 0
Ring-2.6-1T 3.0 10.0 0.0% 0 113.91s 243 4,295 4,416

Comparație rapidă

Schimbă perechea de comparație