#129
OpenAI
Rilis: 2025-08-05
Diuji pada: 2026-05-08 15:31
openai/gpt-oss-120b::none
(medium)
(none)
Harga input
$0.000 / 1M
Harga output
$0.000 / 1M
Tes tidak stabil
3
Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).
Riwayat run
| Diuji pada | Skor | Keandalan | Tes benar | Total Biaya | Bandingkan |
|---|---|---|---|---|---|
| 2026-05-08 15:31 Suite berubah | 5.2 | 10.0 | $0.011 | Run saat ini | |
| 2026-04-21 12:42 Run pertama yang tercatat | 5.2 | T/A | $0.009 | Bandingkan |
Run ini menggunakan suite benchmark yang berbeda. Perhatikan perubahan suite saat membaca pergerakan historis.
Grafik
Pilih model pertama, lalu klik model kedua untuk membuka halaman berdampingan.
Skor vs Total Biaya
Waktu respons (rata-rata)
Skor vs Waktu respons (rata-rata)
Total token output
Skor vs Total token output
Perbandingan Cepat
gpt-oss-120bnoneTersedia gratisvsGLM 4.7 Flashnonegpt-oss-120bnoneTersedia gratisvsgpt-oss-120bmediumTersedia gratisgpt-oss-120bnoneTersedia gratisvsGPT-5.4nonegpt-oss-120bnoneTersedia gratisvsMiMo-V2-Prononegpt-oss-120bnoneTersedia gratisvsGLM 5.1nonegpt-oss-120bnoneTersedia gratisvsGemini 3 Flash Previewmediumgpt-oss-120bnoneTersedia gratisvsGemini 3.5 Flashhighgpt-oss-120bnoneTersedia gratisvsRing-2.6-1Tmediumgpt-oss-120bnoneTersedia gratisvsGemini 3.5 Flashlow
Rincian Kategori
| Kategori | Skor | Konsistensi | Tes benar |
|---|---|---|---|
| Trik anti-AI | 6.5 | 10.0 | |
| Pemrograman | 4.3 | 1.1 | |
| Gabungan | 3.0 | 10.0 | |
| Parsing dan ekstraksi data | 6.5 | 10.0 | |
| Spesifik domain | 3.0 | 10.0 | |
| Kecerdasan umum | 4.8 | 10.0 | |
| Kepatuhan instruksi | 9.8 | 10.0 | |
| Pemecahan teka-teki | 4.4 | 4.5 | |
| Pemanggilan alat | 3.0 | 10.0 | |
| Pengetahuan umum | 3.0 | 10.0 |