Bandingkan Grafik

Bahasa:

❤️ Made by XCS

AI BENCHY Compare

Anthropic: Claude Opus 4.6 vs Inception: Mercury 2

Bandingkan:

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-03-05

Metrik	Anthropic: Claude Opus 4.6 medium Rilis: 2026-02-05	Inception: Mercury 2 none Rilis: 2026-02-24
Peringkat	#30	#50
Skor Rata-rata	64	34
Konsistensi	89	89
Biaya per hasil	14.411	0.147
Total Biaya	$1.297	$0.006
Waktu respons (rata-rata)	25.08s	594ms
Waktu respons (maks)	83.40s	1.27s
Waktu respons (total)	200.67s	8.91s
Tes benar
Tingkat lulus per percobaan	64.4%	33.3%
Tes tidak stabil	2	2
Token output	26,066	1,144
Token penalaran	17,071	0

Model teratas berdasarkan skor

Waktu respons (rata-rata)

Skor vs Total Biaya

Skor Rata-rata vs Waktu respons (rata-rata)

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Anthropic: Claude Opus 4.6	40	44	55.6%	2		11.88s	897	1,000
Inception: Mercury 2	100	100	0.0%	0		466ms	274	0

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Anthropic: Claude Opus 4.6	100	100	100.0%	0		76.66s	8,178	5,194
Inception: Mercury 2	100	100	0.0%	0		606ms	131	0

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Anthropic: Claude Opus 4.6	99	100	100.0%	0		7.37s	691	757
Inception: Mercury 2	55	59	83.3%	1		667ms	180	0

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Anthropic: Claude Opus 4.6	100	100	0.0%	0		83.40s	14,642	8,687
Inception: Mercury 2	40	72	44.4%	1		534ms	46	0

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Anthropic: Claude Opus 4.6	100	100	100.0%	0		2.43s	266	467
Inception: Mercury 2	55	100	50.0%	0		551ms	82	0

Puzzle Solving	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Anthropic: Claude Opus 4.6	70	100	66.7%	0		4.60s	531	637
Inception: Mercury 2	100	100	0.0%	0		533ms	234	0

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token output	Token penalaran
Anthropic: Claude Opus 4.6	100	100	100.0%	0		9.73s	861	329
Inception: Mercury 2	100	100	100.0%	0		1.27s	197	0

Perbandingan Cepat

Ganti Pasangan Perbandingan

Claude Opus 4.6mediumvsQwen3.5 Plus 2026-02-15none Mercury 2nonevsQwen3 Coder Nextmedium Mercury 2nonevsGLM 4.7 Flashmedium Claude Opus 4.6mediumvsGLM 5none Claude Opus 4.6mediumvsGemini 3 Flash Previewnone Claude Opus 4.6mediumvsGemini 3.1 Flash Lite Previewnone Claude Opus 4.6mediumvsGPT-5.3 Chatnone Claude Opus 4.6mediumvsGemini 2.5 Flashnone Claude Opus 4.6mediumvsDeepSeek V3.2none Claude Opus 4.6mediumvsGemini 3.1 Flash Lite Previewlow Claude Opus 4.6mediumvsQwen3.5-122B-A10Bnone Claude Opus 4.6mediumvsGPT-5.2 Chatnone