OpenAI
Veröffentlichung: 2025-08-05
Getestet am: 2026-04-21 12:42
openai/gpt-oss-120b::none
117B insgesamt (5.1B aktiv)MoEOpen Source
(medium)
(none)
Zusammenfassung
gpt-oss-120b erreicht 5.2 bei AI BENCHY und liegt auf #91. Das Modell hat k. A. Zuverlässigkeit, 38.9% Erfolgsrate, $0.009 Gesamtkosten und 11.96s durchschnittliche Antwortzeit.
Was gpt-oss-120b besonders macht: Die Benchmark-Gesamtkosten sind für diese Leistungsklasse ungewöhnlich niedrig.
Modelldaten
Recherchiert am 2026-08-12
- Parameter
- 117B insgesamt (5.1B aktiv)
- Architektur
- MoE
- Verfügbarkeit
- Open Source
- Lizenz
- Apache-2.0
5.2
Konsistenz
7.9
k. A.
Gesamte Ausgabe-Token
44,652
Gesamte Eingabe-Token
0
Eingabepreis
$0.000 / 1M
Ausgabepreis
$0.000 / 1M
Instabile Tests
5
Instabile Tests hatten gemischte Ergebnisse über Läufe hinweg (mindestens ein Erfolg und ein Fehlschlag).
Testverlauf
| Getestet am | Punktzahl | Zuverlässigkeit | Korrekte Tests | Gesamtkosten | Vergleichen |
|---|---|---|---|---|---|
| 2026-05-08 15:31 Suite geändert | 3.7 | 10.0 | $0.010 ↓ | Vergleichen | |
| 2026-04-21 12:42 Erster erfasster Lauf | 5.2 | k. A. | $0.009 | Aktueller Lauf |
Diagramme
Wähle zuerst das erste Modell und klicke dann ein zweites Modell, um eine Seite im direkten Vergleich zu öffnen.
Punktzahl vs Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Schnellvergleich
gpt-oss-120bnoneKostenlos verfügbarvsLing 3.0 Tinymediumgpt-oss-120bnoneKostenlos verfügbarvsQwen3.5-9Bmediumgpt-oss-120bnoneKostenlos verfügbarvsLing 3.0 Tinylowgpt-oss-120bnoneKostenlos verfügbarvsLing 3.0 Tinyhighgpt-oss-120bnoneKostenlos verfügbarvsNemotron 3.5 LightningnoneKostenlos verfügbargpt-oss-120bnoneKostenlos verfügbarvsGranite 4.1 8Bnonegpt-oss-120bnoneKostenlos verfügbarvsLing 3.0 Tinynonegpt-oss-120bnoneKostenlos verfügbarvsGrok 4.20nonegpt-oss-120bnoneKostenlos verfügbarvsGLM 4.7 Flashmediumgpt-oss-120bnoneKostenlos verfügbarvsLaguna S 2.1noneKostenlos verfügbar
Kategorieaufschlüsselung
| Kategorie | Punktzahl | Konsistenz | Korrekte Tests |
|---|---|---|---|
| Anti-KI-Tricks | 6.6 | 8.0 | |
| Programmierung | 4.3 | 1.1 | |
| Kombiniert | 3.0 | 10.0 | |
| Datenanalyse und -extraktion | 6.5 | 10.0 | |
| Domänenspezifisch | 3.0 | 10.0 | |
| Allgemeine Intelligenz | 4.6 | 10.0 | |
| Befolgung von Anweisungen | 8.4 | 6.9 | |
| Rätsellösen | 4.5 | 4.8 | |
| Werkzeugaufrufe | 3.0 | 10.0 |