AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#1

Gemini 3 Flash Preview

Google Veröffentlichung: 2025-12-17 Getestet am: 2026-04-11 01:44 google/gemini-3-flash-preview::medium
~500B insgesamt (~20B aktiv)MoEGeschlossenGeschätzt
(medium) (low) (none)

Zusammenfassung

Gemini 3 Flash Preview erreicht 10.0 bei AI BENCHY und liegt auf #1. Das Modell hat k. A. Zuverlässigkeit, 100.0% Erfolgsrate, $0.314 Gesamtkosten und 17.60s durchschnittliche Antwortzeit.

Was Gemini 3 Flash Preview besonders macht: Es gehört insgesamt zu den bestplatzierten Modellen.

Modelldaten

Recherchiert am 2026-08-12

Geschätzt
Parameter
~500B insgesamt (~20B aktiv)
Architektur
MoE
Verfügbarkeit
Geschlossen
Lizenz
-

Beste Schätzung auf Grundlage öffentlicher Informationen; der Anbieter hat nicht alle Werte offengelegt.

Punktzahl

10.0

Konsistenz

10.0

Zuverlässigkeit

k. A.

Gesamte Ausgabe-Token

99,113

Gesamte Eingabe-Token

0

Eingabepreis

$0.500 / 1M

Ausgabepreis

$3.000 / 1M

Korrekte Tests

Falsche Tests: 0

Erfolgsquote pro Versuch: 100.0%

Instabile Tests

0

Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).

Antwortzeit (Durchschnitt)

17.60s

Antwortzeit (Maximum): 79.71s

Antwortzeit (Gesamt): 193.57s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#1 Gemini 3 Flash Preview

medium
Kosten
$0.010
Zeit
18.4s
Token
3,351 tok

Testverlauf

Getestet am Punktzahl Zuverlässigkeit Korrekte Tests Gesamtkosten Vergleichen
2026-08-14 02:41 Erneuter Test 9.5 10.0 $0.763 Vergleichen
2026-07-16 22:51 Neuer Test hinzugefügt 9.6 10.0 $0.742 Vergleichen
2026-06-04 13:59 Neuer Test hinzugefügt 9.8 10.0 $0.667 Vergleichen
2026-05-22 00:28 Suite geändert 9.8 10.0 $0.567 Vergleichen
2026-05-06 13:52 Suite geändert 10.0 10.0 $0.321 Vergleichen
2026-05-06 13:38 Suite geändert 9.8 10.0 $0.320 Vergleichen
2026-04-23 15:25 Erneuter Test 10.0 k. A. $0.108 Vergleichen
2026-04-11 01:44 Erster erfasster Lauf 10.0 k. A. $0.314 Aktueller Lauf

Laufvergleich

LaufBenchmark-AbdeckungPunktzahlKonsistenzZuverlässigkeitKorrekte TestsInstabile TestsGesamte Ausgabe-TokenGesamte Eingabe-TokenGesamtkostenAntwortzeit (Durchschnitt)
2026-04-11 01:44 · Erster erfasster Lauf54/54 Versuche10.010.0k. A.18/18099,1130$0.31417.60s
2026-04-23 15:25 · Erneuter Test18/54 Versuche10.010.0k. A.18/18034,4040$0.10812.11s
Differenz0.00.000+647090+$0.206+5490ms

Die Benchmark-Abdeckung unterscheidet sich: 54/54 Versuche (Ziel: 3 Wiederholungen pro Test) gegenüber 18/54 Versuche (Ziel: 3 Wiederholungen pro Test). Summen und wiederholungsabhängige Metriken sind nicht direkt vergleichbar.

Diagramme

Wähle zuerst das erste Modell und klicke dann ein zweites Modell, um eine Seite im direkten Vergleich zu öffnen.

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Schnellvergleich

Kategorieaufschlüsselung

Kategorie Punktzahl Konsistenz Korrekte Tests
Anti-KI-Tricks 10.0 10.0
Programmierung 10.0 10.0
Kombiniert 10.0 10.0
Datenanalyse und -extraktion 10.0 10.0
Domänenspezifisch 10.0 10.0
Allgemeine Intelligenz 10.0 10.0
Befolgung von Anweisungen 10.0 10.0
Rätsellösen 10.0 10.0
Werkzeugaufrufe 10.0 10.0

Verglichene Modelle