AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#1

Gemini 3 Flash Preview

Google Veröffentlichung: 2025-12-17 Getestet am: 2026-04-23 15:25 google/gemini-3-flash-preview::medium
~500B insgesamt (~20B aktiv)MoEGeschlossenGeschätzt
(medium) (low) (none)

Zusammenfassung

Gemini 3 Flash Preview erreicht 10.0 bei AI BENCHY und liegt auf #1. Das Modell hat k. A. Zuverlässigkeit, 100.0% Erfolgsrate, $0.108 Gesamtkosten und 12.11s durchschnittliche Antwortzeit.

Was Gemini 3 Flash Preview besonders macht: Es gehört insgesamt zu den bestplatzierten Modellen. Die Benchmark-Gesamtkosten sind für diese Leistungsklasse ungewöhnlich niedrig.

Modelldaten

Recherchiert am 2026-08-12

Geschätzt
Parameter
~500B insgesamt (~20B aktiv)
Architektur
MoE
Verfügbarkeit
Geschlossen
Lizenz
-

Beste Schätzung auf Grundlage öffentlicher Informationen; der Anbieter hat nicht alle Werte offengelegt.

Punktzahl

10.0

Konsistenz

10.0

Zuverlässigkeit

k. A.

Gesamte Ausgabe-Token

34,404

Gesamte Eingabe-Token

0

Eingabepreis

$0.500 / 1M

Ausgabepreis

$3.000 / 1M

Korrekte Tests

Falsche Tests: 0

Erfolgsquote pro Versuch: 100.0%

Benchmark-Abdeckung: 18/54 Versuche

Instabile Tests

0

Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).

Antwortzeit (Durchschnitt)

12.11s

Antwortzeit (Maximum): 82.37s

Antwortzeit (Gesamt): 217.93s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#1 Gemini 3 Flash Preview

medium
Kosten
$0.010
Zeit
18.4s
Token
3,351 tok

Testverlauf

Getestet am Punktzahl Zuverlässigkeit Korrekte Tests Gesamtkosten Vergleichen
2026-08-14 02:41 Erneuter Test 9.5 10.0 $0.763 Vergleichen
2026-07-16 22:51 Neuer Test hinzugefügt 9.6 10.0 $0.742 Vergleichen
2026-06-04 13:59 Neuer Test hinzugefügt 9.8 10.0 $0.667 Vergleichen
2026-05-22 00:28 Suite geändert 9.8 10.0 $0.567 Vergleichen
2026-05-06 13:52 Suite geändert 10.0 10.0 $0.321 Vergleichen
2026-05-06 13:38 Suite geändert 9.8 10.0 $0.320 Vergleichen
2026-04-23 15:25 Erneuter Test 10.0 k. A. $0.108 Aktueller Lauf
2026-04-11 01:44 Erster erfasster Lauf 10.0 k. A. $0.314 Vergleichen

Laufvergleich

LaufBenchmark-AbdeckungPunktzahlKonsistenzZuverlässigkeitKorrekte TestsInstabile TestsGesamte Ausgabe-TokenGesamte Eingabe-TokenGesamtkostenAntwortzeit (Durchschnitt)
2026-04-23 15:25 · Erneuter Test18/54 Versuche10.010.0k. A.18/18034,4040$0.10812.11s
2026-04-11 01:44 · Erster erfasster Lauf54/54 Versuche10.010.0k. A.18/18099,1130$0.31417.60s
Differenz0.00.000-647090-$0.206-5490ms

Die Benchmark-Abdeckung unterscheidet sich: 18/54 Versuche (Ziel: 3 Wiederholungen pro Test) gegenüber 54/54 Versuche (Ziel: 3 Wiederholungen pro Test). Summen und wiederholungsabhängige Metriken sind nicht direkt vergleichbar.

Diagramme

Wähle zuerst das erste Modell und klicke dann ein zweites Modell, um eine Seite im direkten Vergleich zu öffnen.

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Schnellvergleich

Kategorieaufschlüsselung

Kategorie Punktzahl Konsistenz Korrekte Tests
Anti-KI-Tricks 10.0 10.0
Programmierung 10.0 10.0
Kombiniert 10.0 10.0
Datenanalyse und -extraktion 10.0 10.0
Domänenspezifisch 10.0 10.0
Allgemeine Intelligenz 10.0 10.0
Befolgung von Anweisungen 10.0 10.0
Rätsellösen 10.0 10.0
Werkzeugaufrufe 10.0 10.0

Verglichene Modelle