Navigare
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

ByteDance Seed: Seed-2.0-Lite vs Inception: Mercury 2

Rezumat

Comparație benchmark Seed-2.0-Lite vs Mercury 2: Mercury 2 conduce la scorul mediu cu 6.6 vs 5.8. Seed-2.0-Lite are costul de benchmark mai mic, $0.019 vs $0.058. Mercury 2 este mai rapid cu 2.24s vs 2.49s, cu rate de reușită de 46.0% vs 54.0%.

Model recomandat: Seed-2.0-Lite - Oferă cel mai bun compromis per total: scor competitiv (5.8), cost mai mic decât Mercury 2 și timp de răspuns echilibrat.

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-06-10

Metrică Seed-2.0-Lite Seed-2.0-Lite none Lansare: 2026-02-14 Mercury 2 Mercury 2 medium Lansare: 2026-02-24
Scor 5.8 6.6
Rang #111 #82
Fiabilitate 10.0 10.0
Consistență 8.4 8.8
Teste corecte
Rată de trecere pe încercare 46.0% 54.0%
Teste instabile 4 3
Rulări totale 63 63
Cost per rezultat 0.228 0.578
Cost total $0.019 $0.058
Preț de intrare $0.250 / 1M $0.250 / 1M
Preț de ieșire $2.000 / 1M $0.750 / 1M
Total tokenuri de intrare 46,573 35,116
Tokenuri de ieșire 3,259 4,048
Tokenuri de raționament 0 61,219
Timp de răspuns (mediu) 2.49s 2.24s
Timp de răspuns (maxim) 6.70s 14.63s
Timp de răspuns (total) 52.26s 44.72s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#111 Seed-2.0-Lite

none
Cost
$0.005
Time
83.8s
Tokens
2,311 tok

#82 Mercury 2

medium
Cost
$0.002
Time
2.1s
Tokens
1,702 tok

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Seed-2.0-Lite 3.0 5.9 16.7% 2 2.43s 894 709 0
Mercury 2 6.9 9.9 50.0% 0 1.12s 554 2,546 2,609
Programare Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Seed-2.0-Lite 5.6 10.0 33.3% 0 2.83s 8,215 410 0
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
Combinat Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Seed-2.0-Lite 3.0 10.0 0.0% 0 6.59s 16,215 498 0
Mercury 2 10.0 10.0 100.0% 0 3.28s 12,909 268 4,887
Parsare și extragere de date Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Seed-2.0-Lite 10.0 10.0 100.0% 0 1.82s 8,538 246 0
Mercury 2 7.3 5.9 83.3% 1 1.11s 6,234 183 1,656
Specific domeniului Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Seed-2.0-Lite 3.6 7.2 22.2% 1 1.33s 939 17 0
Mercury 2 2.9 7.2 11.1% 1 6.48s 695 41 30,754
Inteligență generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Seed-2.0-Lite 10.0 10.0 100.0% 0 3.45s 570 294 0
Mercury 2 4.8 10.0 0.0% 0 821ms 456 137 542
Respectarea instrucțiunilor Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Seed-2.0-Lite 10.0 10.0 100.0% 0 1.06s 810 73 0
Mercury 2 10.0 10.0 100.0% 0 1.07s 340 14 958
Rezolvare de puzzle-uri Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Seed-2.0-Lite 5.3 7.2 44.4% 1 2.78s 858 709 0
Mercury 2 5.4 10.0 33.3% 0 949ms 601 361 2,781
Apelare instrumente Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Seed-2.0-Lite 10.0 10.0 100.0% 0 3.94s 9,270 292 0
Mercury 2 10.0 10.0 100.0% 0 1.89s 6,080 180 1,956
Cultură generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Seed-2.0-Lite 3.0 10.0 0.0% 0 1.96s 264 11 0
Mercury 2 3.0 10.0 0.0% 0 2.58s 182 22 3,748

Comparație rapidă

Schimbă perechea de comparație