Peringkat kegagalan Jawaban salah

Lihat model AI mana yang paling sering mengalami Jawaban salah, agar Anda bisa melihat risiko keandalan sebelum memilih. Urutkan berdasarkan: Jumlah kegagalan ↑.

Model yang ditampilkan

Total kegagalan

1558

Model yang paling terdampak

Gemini 3 Flash Preview 1

Kategori

Dalam kategori Spesifik domain412 Dalam kategori Trik anti-AI293 Dalam kategori Pemrograman252 Dalam kategori Pemecahan teka-teki201 Dalam kategori Pengetahuan umum168 Dalam kategori Gabungan68 Dalam kategori Kepatuhan instruksi61 Dalam kategori Kecerdasan umum59 Dalam kategori Parsing dan ekstraksi data41 Dalam kategori Pemanggilan alat3

209/209

Peringkat	Model	Perusahaan	Jumlah Jawaban salah	Skor	Total Biaya	Tes benar	Waktu respons (rata-rata)
#14	Claude Opus 4.8 medium	Anthropic	3	8.8	$1.931	18/22	12.5s
Total Tes 22 Tes Salah 4 Total Biaya $1.931 Waktu respons (rata-rata) 12.5s
#15	Claude Opus 4.7 medium	Anthropic	3	8.7	$1.477	18/22	7.61s
Total Tes 22 Tes Salah 4 Total Biaya $1.477 Waktu respons (rata-rata) 7.61s
#21	GPT-5.2 medium	OpenAI	3	8.4	$0.951	14/22	22.6s
Total Tes 22 Tes Salah 8 Total Biaya $0.951 Waktu respons (rata-rata) 22.6s
#31	GLM 5.2 high	Z.ai	3	8.0	$0.970	14/22	62.7s
Total Tes 22 Tes Salah 8 Total Biaya $0.970 Waktu respons (rata-rata) 62.7s
#38	GLM 5.2 medium	Z.ai	3	7.8	$0.222	15/21	23.3s
Total Tes 21 Tes Salah 6 Total Biaya $0.222 Waktu respons (rata-rata) 23.3s
#42	GLM 5 medium	Z.ai	3	7.7	$0.307	15/21	33.5s
Total Tes 21 Tes Salah 6 Total Biaya $0.307 Waktu respons (rata-rata) 33.5s
#43	Claude Opus 4.6 medium	Anthropic	3	7.7	$3.059	13/22	34.3s
Total Tes 22 Tes Salah 9 Total Biaya $3.059 Waktu respons (rata-rata) 34.3s
#47	MiniMax M3 medium	Minimax	3	7.6	$0.286	12/22	75.0s
Total Tes 22 Tes Salah 10 Total Biaya $0.286 Waktu respons (rata-rata) 75.0s
#68	Kimi K2.6 medium	Moonshot AI	3	7.2	$1.036	12/22	110.0s
Total Tes 22 Tes Salah 10 Total Biaya $1.036 Waktu respons (rata-rata) 110.0s
#79	Gemini 3.5 Flash none	Google	3	7.0	$1.079	15/22	9.93s
Total Tes 22 Tes Salah 7 Total Biaya $1.079 Waktu respons (rata-rata) 9.93s
#84	MiMo-V2.5-Pro medium	Xiaomi	3	6.9	$0.187	12/22	33.9s
Total Tes 22 Tes Salah 10 Total Biaya $0.187 Waktu respons (rata-rata) 33.9s
#94	Claude Opus 4.7 none	Anthropic	3	6.6	$0.505	16/19	3.02s
Total Tes 19 Tes Salah 3 Total Biaya $0.505 Waktu respons (rata-rata) 3.02s
#95	Gemma 4 26B A4B medium	Google	3	6.6	$0.089	14/22	103.8s
Total Tes 22 Tes Salah 8 Total Biaya $0.089 Waktu respons (rata-rata) 103.8s
#100	Hy3 preview medium	Tencent	3	6.5	$0.018	14/21	16.3s
Total Tes 21 Tes Salah 7 Total Biaya $0.018 Waktu respons (rata-rata) 16.3s
#131	Grok 4.20 Beta medium	X AI	3	6.0	$0.750	14/18	9.75s
Total Tes 18 Tes Salah 4 Total Biaya $0.750 Waktu respons (rata-rata) 9.75s

Kegagalan Jawaban salah

Filter model

Model teratas menurut Jumlah Jawaban salah

Jumlah Jawaban salah vs Skor

Model teratas menurut Waktu respons (rata-rata)