AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#6

Claude Opus 4.7

Anthropic Rilis: 2026-04-16 Diuji pada: 2026-05-08 13:36 anthropic/claude-opus-4.7::none
~5T total (~500B aktif)MoETertutupPerkiraan
(medium) (none)

Ringkasan

Claude Opus 4.7 mendapat skor 8.9 di AI BENCHY dan berada di peringkat #6. Model ini memiliki reliabilitas 10.0, tingkat keberhasilan 84.2%, total biaya $0.507, dan waktu respons rata-rata 3.04s.

Yang membuat Claude Opus 4.7 unik: Model ini paling menonjol di Spesifik domain, dengan peringkat #3, sementara Trik anti-AI adalah area terlemahnya di #14. Model ini terasa cepat dibandingkan model serupa.

Model diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru.

Fakta model

Ditelaah pada 2026-08-12

Perkiraan
Parameter
~5T total (~500B aktif)
Arsitektur
MoE
Ketersediaan
Tertutup
Lisensi
-

Perkiraan terbaik berdasarkan bukti publik; penyedia tidak mengungkapkan semua nilai.

Skor

8.9

Konsistensi

10.0

Keandalan

10.0

Total token output

6,329

Total token input

0

Harga input

$5.000 / 1M

Harga output

$25.000 / 1M

Tes benar

Tes Salah: 3

Tingkat lulus per percobaan: 84.2%

Tes tidak stabil

0

Tes tidak stabil memiliki hasil campuran antar run (setidaknya satu lulus dan satu gagal).

Waktu respons (rata-rata)

3.04s

Waktu respons (maks): 18.27s

Waktu respons (total): 57.79s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#6 Claude Opus 4.7

none
Biaya
$0.051
Waktu
24.2s
Token
2,181 tok

Riwayat run

Diuji pada Skor Keandalan Tes benar Total Biaya Bandingkan
2026-05-08 13:36 Uji ulang 6.6 10.0 $0.505 Bandingkan
2026-05-08 13:36 Uji ulang 6.6 10.0 $0.505 Bandingkan
2026-05-08 13:36 Uji ulang 8.9 10.0 $0.505 Bandingkan
2026-05-08 13:36 Uji ulang 8.9 10.0 $0.507 Bandingkan
2026-05-08 13:36 Suite berubah 8.9 10.0 $0.507 Run saat ini
2026-04-16 15:59 Run pertama yang tercatat 9.2 T/A $0.505 Bandingkan

Run ini menggunakan suite benchmark yang berbeda. Perhatikan perubahan suite saat membaca pergerakan historis.

Perbandingan run

RunCakupan benchmarkSkorKonsistensiKeandalanTes benarTes tidak stabilTotal token outputTotal token inputTotal BiayaWaktu respons (rata-rata)
2026-05-08 13:36 · Suite berubah57/57 percobaan8.910.010.016/1906,3290$0.5073.04s
2026-05-08 13:36 · Uji ulang57/57 percobaan8.910.010.016/1906,3290$0.5073.04s
Selisih0.00.00.00000$0.0000ms

Grafik

Pilih model pertama, lalu klik model kedua untuk membuka halaman berdampingan.

Total token output

Skor vs Total token output

Rincian Kategori

Kategori Skor Konsistensi Tes benar
Trik anti-AI 8.3 10.0
Pemrograman 10.0 10.0
Gabungan 9.5 10.0
Parsing dan ekstraksi data 10.0 10.0
Spesifik domain 7.7 10.0
Kecerdasan umum 10.0 10.0
Kepatuhan instruksi 10.0 10.0
Pemecahan teka-teki 10.0 10.0
Pemanggilan alat 10.0 10.0
Pengetahuan umum 3.0 10.0

Model yang Dibandingkan