Bandingkan Grafik

Bahasa:

❤️ Made by XCS

AI BENCHY Compare

Anthropic: Claude Sonnet 4.6 vs Google: Gemini 3.1 Flash Lite Preview

Bandingkan:

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-03-03

Metrik	Anthropic: Claude Sonnet 4.6 medium Rilis: 2026-02-17	Google: Gemini 3.1 Flash Lite Preview none Rilis: 2026-03-03
Peringkat	#11	#10
Skor Rata-rata	7.43	7.70
Konsistensi	9.40	9.54
Biaya per hasil	8.105	0.116
Total Biaya	$0.811	$0.011
Tes benar
Tingkat lulus per percobaan	73.8%	69.1%
Tes tidak stabil	1	1
Token output	29,098	4,307
Token penalaran	20,435	0

Model teratas berdasarkan skor

Skor vs Total Biaya

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Token output	Token penalaran
Anthropic: Claude Sonnet 4.6	7.00	10.00	66.7%	0		1,031	1,093
Google: Gemini 3.1 Flash Lite Preview	6.00	7.85	55.6%	1		1,086	0

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Token output	Token penalaran
Anthropic: Claude Sonnet 4.6	10.00	10.00	100.0%	0		727	907
Google: Gemini 3.1 Flash Lite Preview	9.88	10.00	100.0%	0		399	0

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Token output	Token penalaran
Anthropic: Claude Sonnet 4.6	1.00	7.21	11.1%	1		25,790	16,919
Google: Gemini 3.1 Flash Lite Preview	4.00	10.00	33.3%	0		568	0

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Token output	Token penalaran
Anthropic: Claude Sonnet 4.6	10.00	10.00	100.0%	0		316	523
Google: Gemini 3.1 Flash Lite Preview	9.00	10.00	50.0%	0		574	0

Puzzle Solving	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Token output	Token penalaran
Anthropic: Claude Sonnet 4.6	10.00	10.00	100.0%	0		579	642
Google: Gemini 3.1 Flash Lite Preview	10.00	10.00	100.0%	0		898	0

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Token output	Token penalaran
Anthropic: Claude Sonnet 4.6	10.00	10.00	100.0%	0		655	351
Google: Gemini 3.1 Flash Lite Preview	10.00	10.00	100.0%	0		782	0

Perbandingan Cepat

Ganti Pasangan Perbandingan

Claude Sonnet 4.6mediumvsGPT-5.2 Chatnone Claude Sonnet 4.6mediumvsGPT-5.3 Chatnone Claude Sonnet 4.6mediumvsGemini 3 Flash Previewnone Gemini 3.1 Flash Lite PreviewnonevsGPT-5.3-Codexmedium Claude Sonnet 4.6mediumvsGemini 3.1 Flash Lite Previewhigh Claude Sonnet 4.6mediumvsGemini 3.1 Flash Lite Previewlow Gemini 3.1 Flash Lite PreviewnonevsGLM 5medium Gemini 3.1 Flash Lite PreviewnonevsStep 3.5 FlashmediumTersedia gratis DeepSeek V3.2mediumvsGemini 3.1 Flash Lite Previewnone Gemini 3.1 Flash Lite PreviewnonevsGPT-5.2medium Gemini 3.1 Flash Lite PreviewnonevsQwen3.5-27Bmedium Gemini 3.1 Flash Lite PreviewnonevsQwen3.5-122B-A10Bmedium