Navigation
AI BENCHY
Your ad here

AI BENCHY Compare

ByteDance Seed: Seed-2.0-Lite vs Inception: Mercury 2

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-03-12

Metrik Seed-2.0-Lite Seed-2.0-Lite none Veröffentlichung: 2026-02-14 Mercury 2 Mercury 2 medium Veröffentlichung: 2026-02-24
Rang #45 #40
Ø-Score 4.9 5.3
Konsistenz 7.4 8.4
Kosten pro Ergebnis 0.214 0.631
Gesamtkosten $0.015 $0.045
Korrekte Tests
Erfolgsquote pro Versuch 56.3% 54.2%
Instabile Tests 5 3
Gesamtläufe 48 48
Ausgabe-Token 2,743 3,708
Denk-Token 0 45,921
Antwortzeit (Durchschnitt) 2.49s 2.36s
Antwortzeit (Maximum) 6.70s 14.63s
Antwortzeit (Gesamt) 39.91s 35.39s

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Ø-Score vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Ø-Score vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Anti-KI-Tricks Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Ausgabe-Token Denk-Token
Seed-2.0-Lite 10.0 4.6 22.2% 2 2.93s 703 0
Mercury 2 7.3 9.8 66.7% 0 1.30s 2,531 2,410
Kombiniert Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Ausgabe-Token Denk-Token
Seed-2.0-Lite 10.0 10.0 0.0% 0 6.59s 498 0
Mercury 2 10.0 10.0 100.0% 0 3.28s 268 4,887
Datenanalyse und -extraktion Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Ausgabe-Token Denk-Token
Seed-2.0-Lite 9.9 10.0 100.0% 0 1.82s 246 0
Mercury 2 5.5 5.9 83.3% 1 1.11s 183 1,656
Domänenspezifisch Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Ausgabe-Token Denk-Token
Seed-2.0-Lite 10.0 7.2 22.2% 1 1.33s 17 0
Mercury 2 10.0 7.2 11.1% 1 6.48s 41 30,754
Allgemeine Intelligenz Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Ausgabe-Token Denk-Token
Seed-2.0-Lite 10.0 10.0 100.0% 0 3.45s 294 0
Mercury 2 4.0 10.0 0.0% 0 821ms 137 542
Befolgung von Anweisungen Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Ausgabe-Token Denk-Token
Seed-2.0-Lite 10.0 10.0 100.0% 0 1.06s 73 0
Mercury 2 10.0 10.0 100.0% 0 1.07s 14 958
Puzzle Solving Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Ausgabe-Token Denk-Token
Seed-2.0-Lite 4.0 4.4 55.6% 2 2.46s 620 0
Mercury 2 1.7 7.5 22.2% 1 934ms 354 2,758
Werkzeugaufrufe Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Ausgabe-Token Denk-Token
Seed-2.0-Lite 10.0 10.0 100.0% 0 3.94s 292 0
Mercury 2 10.0 10.0 100.0% 0 1.89s 180 1,956

Schnellvergleich

Vergleichspaar wechseln