Nemotron 3 Ultra 550b A55b vs Qwen3.6 Plus Preview
Zusammenfassung
Nemotron 3 Ultra 550b A55b vs Qwen3.6 Plus Preview Benchmark-Vergleich: Nemotron 3 Ultra 550b A55b führt beim Durchschnittsscore mit 8.1 vs 5.8. Qwen3.6 Plus Preview hat die niedrigeren Benchmark-Kosten mit $0.000 vs $0.158. Nemotron 3 Ultra 550b A55b ist schneller mit 15.05s vs 15.25s, mit Erfolgsraten von 69.8% vs 42.9%.
Empfohlenes Modell: Nemotron 3 Ultra 550b A55b - Es hat die stärkste Punktzahl in diesem Vergleich (8.1) und die beste Gesamtbalance aus Kosten und Antwortzeit über alle 2 Modelle.
Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-06-18
Qwen3.6 Plus PreviewQwen3.6 Plus PreviewmediumArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.Veröffentlichung: 2026-04-20Kostenlos verfügbar
Qwen3.6 Plus PreviewQwen3.6 Plus PreviewmediumArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.Veröffentlichung: 2026-04-20Kostenlos verfügbar
Punktzahl
8.1Durchschnittswert über alle Benchmark-Tests.…
5.8Durchschnittswert über alle Benchmark-Tests.…
Rang
#26
#113
Zuverlässigkeit
9.7Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
k. A.Erfolgswert beim ersten Versuch: 10.0 bedeutet keine wiederholbaren Ziel-API- oder Rate-Limit-Fehler vor erfolgreichen Aufrufen; erfasste Fehler senken den Wert.…
Konsistenz
8.8Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
9.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
Korrekte Tests
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 7API-Fehler: 1Antwortzeit (Durchschnitt)15.05sAntwortzeit (Maximum)43.93sAntwortzeit (Gesamt)316.09sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 8Falsche Antwort: 2Antwortzeit (Durchschnitt)15.25sAntwortzeit (Maximum)43.55sAntwortzeit (Gesamt)182.96sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
Erfolgsquote pro Versuch
69.8%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
42.9%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
Instabile Tests
3Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Gesamtläufe
63Gesamtläufe…
57Gesamtläufe…
Kosten pro Ergebnis
0.000Zeigt die durchschnittlichen Kosten pro korrekter Benchmark-Antwort in Cent an (niedriger ist besser).…
0.000Zeigt die durchschnittlichen Kosten pro korrekter Benchmark-Antwort in Cent an (niedriger ist besser).…
Gesamtkosten
$0.158Gesamtkosten (aktueller Preis)…
$0.000Gesamtkosten (aktueller Preis)…
Eingabepreis
$0.500 / 1MEingabepreis…
$0.000 / 1MEingabepreis…
Ausgabepreis
$2.200 / 1MAusgabepreis…
$0.000 / 1MAusgabepreis…
Gesamte Eingabe-Token
46,813Gesamte Eingabe-Token…
32,639Gesamte Eingabe-Token…
Ausgabe-Token
18,002Ausgabe-Token…
1,153Ausgabe-Token…
Denk-Token
53,091Denk-Token…
62,197Denk-Token…
Antwortzeit (Durchschnitt)
15.05sAntwortzeit (Durchschnitt)…
15.25sAntwortzeit (Durchschnitt)…
Antwortzeit (Maximum)
43.93sAntwortzeit (Maximum)…
43.55sAntwortzeit (Maximum)…
Antwortzeit (Gesamt)
316.09sAntwortzeit (Gesamt)…
182.96sAntwortzeit (Gesamt)…
Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#26 Nemotron 3 Ultra 550b A55b
medium
Ungültiges SVG
Kosten
$0.000
Zeit
300.0s
Token
0 tok
#113 Qwen3.6 Plus Preview
medium
Für dieses Modell wurde noch kein Showcase-Ergebnis generiert.
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)8.62sAntwortzeit (Maximum)16.86sAntwortzeit (Gesamt)34.49sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
8.62sAntwortzeit (Durchschnitt)…
780Gesamte Eingabe-Token…
835Ausgabe-Token…
1,485Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
8.3Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
75.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Antwortzeit (Durchschnitt)11.69sAntwortzeit (Maximum)19.37sAntwortzeit (Gesamt)35.08sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
7.4Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
88.9%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
1Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)26.53sAntwortzeit (Maximum)31.91sAntwortzeit (Gesamt)79.58sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
26.53sAntwortzeit (Durchschnitt)…
7,686Gesamte Eingabe-Token…
2,854Ausgabe-Token…
17,725Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
9.8Durchschnittswert über alle Benchmark-Tests.…
3.3Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Antwortzeit (Durchschnitt)0msAntwortzeit (Maximum)0msAntwortzeit (Gesamt)0msEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)43.93sAntwortzeit (Maximum)43.93sAntwortzeit (Gesamt)43.93sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
43.93sAntwortzeit (Durchschnitt)…
17,574Gesamte Eingabe-Token…
1,040Ausgabe-Token…
3,590Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)34.95sAntwortzeit (Maximum)34.95sAntwortzeit (Gesamt)34.95sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)5.68sAntwortzeit (Maximum)7.94sAntwortzeit (Gesamt)11.36sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
5.68sAntwortzeit (Durchschnitt)…
7,989Gesamte Eingabe-Token…
473Ausgabe-Token…
1,285Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)14.95sAntwortzeit (Maximum)15.40sAntwortzeit (Gesamt)29.90sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
4.4Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
2Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 3Antwortzeit (Durchschnitt)24.90sAntwortzeit (Maximum)34.96sAntwortzeit (Gesamt)74.71sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
24.90sAntwortzeit (Durchschnitt)…
858Gesamte Eingabe-Token…
11,169Ausgabe-Token…
16,249Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2API-Fehler: 1Antwortzeit (Durchschnitt)22.08sAntwortzeit (Maximum)43.55sAntwortzeit (Gesamt)66.23sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
9.5Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Antwortzeit (Durchschnitt)2.52sAntwortzeit (Maximum)2.52sAntwortzeit (Gesamt)2.52sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
2.52sAntwortzeit (Durchschnitt)…
360Gesamte Eingabe-Token…
70Ausgabe-Token…
235Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Antwortzeit (Durchschnitt)0msAntwortzeit (Maximum)0msAntwortzeit (Gesamt)0msEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)6.35sAntwortzeit (Maximum)9.38sAntwortzeit (Gesamt)12.69sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
6.35sAntwortzeit (Durchschnitt)…
765Gesamte Eingabe-Token…
182Ausgabe-Token…
1,243Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
6.5Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
50.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Antwortzeit (Durchschnitt)3.40sAntwortzeit (Maximum)3.40sAntwortzeit (Gesamt)3.40sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
9.9Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 2Antwortzeit (Durchschnitt)3.54sAntwortzeit (Maximum)6.03sAntwortzeit (Gesamt)10.62sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
3.54sAntwortzeit (Durchschnitt)…
792Gesamte Eingabe-Token…
771Ausgabe-Token…
2,055Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
5.3Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
33.3%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 2Antwortzeit (Durchschnitt)7.52sAntwortzeit (Maximum)7.52sAntwortzeit (Gesamt)7.52sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)7.72sAntwortzeit (Maximum)7.72sAntwortzeit (Gesamt)7.72sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
7.72sAntwortzeit (Durchschnitt)…
9,781Gesamte Eingabe-Token…
304Ausgabe-Token…
984Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
10.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
100.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Keine fehlgeschlagenen Antworten.Antwortzeit (Durchschnitt)5.87sAntwortzeit (Maximum)5.87sAntwortzeit (Gesamt)5.87sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.Falsche Antwort: 1Antwortzeit (Durchschnitt)38.47sAntwortzeit (Maximum)38.47sAntwortzeit (Gesamt)38.47sEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…
38.47sAntwortzeit (Durchschnitt)…
228Gesamte Eingabe-Token…
304Ausgabe-Token…
8,240Denk-Token…
Qwen3.6 Plus PreviewArchiviertes Modell: Dieses Modell wird nicht mehr aktualisiert und nicht mehr in neuen Tests getestet.
3.0Durchschnittswert über alle Benchmark-Tests.…
10.0Der Konsistenzwert zeigt die Stabilität zwischen Läufen (10 = sehr konsistent, auch wenn konsistent falsch).…
0.0%Erfolgsquote pro Versuch = bestandene Versuche / Gesamtversuche über alle Läufe.…
0Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).…
Ein Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.API-Fehler: 1Antwortzeit (Durchschnitt)0msAntwortzeit (Maximum)0msAntwortzeit (Gesamt)0msEin Test gilt nur dann als vollständig bestanden, wenn alle Läufe bestanden wurden.…