AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs Qwen: Qwen3.6 27B

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-06-04

Metrik	Claude Opus 4.8 Claude Opus 4.8 none Rilis: 2026-05-28	Qwen3.6 27B Qwen3.6 27B medium Rilis: 2026-04-20

Metrik	Claude Opus 4.8 Claude Opus 4.8 none Rilis: 2026-05-28	Qwen3.6 27B Qwen3.6 27B medium Rilis: 2026-04-20
Skor	7.0	6.8
Peringkat	#68	#78
Keandalan	10.0	10.0
Konsistensi	9.2	8.2
Tes benar
Tingkat lulus per percobaan	61.9%	60.3%
Tes tidak stabil	2	5
Total Run	63	63
Biaya per hasil	4.485	3.361
Total Biaya	$0.539	$0.444
Harga input	$5.000 / 1M	$0.290 / 1M
Harga output	$25.000 / 1M	$3.200 / 1M
Total token input	67,104	39,376
Token output	8,107	16,189
Token penalaran	0	122,521
Waktu respons (rata-rata)	3.47s	59.71s
Waktu respons (maks)	17.73s	168.22s
Waktu respons (total)	72.90s	1254.01s

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Opus 4.8	6.5	10.0	50.0%	0		3.40s	834	1,472	0
Qwen3.6 27B	8.3	10.0	75.0%	0		12.62s	453	582	4,311

Pemrograman	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Opus 4.8	5.5	10.0	33.3%	0		3.29s	10,590	1,332	0
Qwen3.6 27B	7.7	10.0	66.7%	0		142.99s	5,051	7,968	43,367

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Opus 4.8	9.5	10.0	100.0%	0		17.73s	29,658	3,259	0
Qwen3.6 27B	7.0	3.7	66.7%	1		83.07s	15,104	2,088	14,689

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Opus 4.8	7.3	5.8	83.3%	1		1.77s	10,503	308	0
Qwen3.6 27B	3.5	1.4	50.0%	2		37.30s	7,778	568	9,404

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Opus 4.8	5.3	7.2	44.4%	1		1.66s	975	61	0
Qwen3.6 27B	2.9	7.2	11.1%	1		73.38s	662	3,510	20,352

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Opus 4.8	10.0	10.0	100.0%	0		3.48s	708	230	0
Qwen3.6 27B	6.5	3.4	66.7%	1		39.53s	516	81	3,045

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Opus 4.8	9.9	10.0	100.0%	0		1.37s	909	95	0
Qwen3.6 27B	10.0	10.0	100.0%	0		37.96s	699	346	6,548

Pemecahan teka-teki	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Opus 4.8	7.7	10.0	66.7%	0		2.74s	894	783	0
Qwen3.6 27B	7.7	10.0	66.7%	0		61.14s	696	255	12,044

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Opus 4.8	10.0	10.0	100.0%	0		5.35s	11,775	355	0
Qwen3.6 27B	10.0	10.0	100.0%	0		16.88s	8,213	390	2,954

Pengetahuan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Claude Opus 4.8	3.0	10.0	0.0%	0		3.41s	258	212	0
Qwen3.6 27B	3.0	10.0	0.0%	0		80.99s	204	401	5,807

Perbandingan Cepat

Ganti Pasangan Perbandingan

Claude Opus 4.8nonevsMiniMax M3medium Claude Opus 4.8nonevsGPT-5.4 Nanomedium Claude Opus 4.8nonevsStep 3.7 Flashhigh Claude Sonnet 4.6nonevsQwen3.6 27Bmedium Claude Opus 4.8nonevsDeepSeek V3.2medium Claude Opus 4.8nonevsQwen3.5-35B-A3Bmedium Claude Opus 4.8nonevsGrok 4.20medium Claude Opus 4.8nonevsMiMo-V2-Flashmedium Claude Opus 4.8nonevsSeed-2.0-Minimedium Claude Opus 4.8nonevsStep 3.5 Flashmedium Claude Opus 4.8nonevsGemini 3.1 Flash Litelow Claude Opus 4.8nonevsKimi K2.6mediumTersedia gratis