AI BENCHY Compare

Mistral: Mistral Small 4 vs Qwen: Qwen3.5-35B-A3B

Ringkasan

Perbandingan benchmark Mistral Small 4 vs Qwen3.5-35B-A3B: Qwen3.5-35B-A3B unggul dalam skor rata-rata dengan 5.9 vs 5.1. Mistral Small 4 memiliki biaya benchmark lebih rendah di $0.007 vs $0.012. Mistral Small 4 lebih cepat di 630ms vs 3.37s, dengan tingkat keberhasilan 27.0% vs 42.9%.

Model yang direkomendasikan: Mistral Small 4 - Its score stays close to the best score here (5.1 vs 5.9), while costing about 1.6x less than Qwen3.5-35B-A3B.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-06-12

Metrik	Mistral Small 4 Mistral Small 4 none Rilis: 2026-03-16	Qwen3.5-35B-A3B Qwen3.5-35B-A3B none Rilis: 2026-02-24

Metrik	Mistral Small 4 Mistral Small 4 none Rilis: 2026-03-16	Qwen3.5-35B-A3B Qwen3.5-35B-A3B none Rilis: 2026-02-24
Skor	5.1	5.9
Peringkat	#136	#108
Keandalan	10.0	10.0
Konsistensi	9.5	8.9
Tes benar
Tingkat lulus per percobaan	27.0%	42.9%
Tes tidak stabil	1	3
Total Run	63	63
Biaya per hasil	0.139	0.230
Total Biaya	$0.007	$0.012
Harga input	$0.150 / 1M	$0.140 / 1M
Harga output	$0.600 / 1M	$1.000 / 1M
Total token input	37,309	48,194
Token output	2,201	4,343
Token penalaran	0	0
Waktu respons (rata-rata)	630ms	3.37s
Waktu respons (maks)	1.72s	47.43s
Waktu respons (total)	13.22s	70.75s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#136 Mistral Small 4

none

Cost: $0.002
Time: 10.4s
Tokens: 2,370 tok

#108 Qwen3.5-35B-A3B

none

Cost: $0.005
Time: 28.4s
Tokens: 4,518 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Mistral Small 4	3.4	7.9	16.7%	1		395ms	708	182	0
Qwen3.5-35B-A3B	3.4	7.9	16.7%	1		1.43s	696	574	0

Pemrograman	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Mistral Small 4	3.7	9.7	0.0%	0		901ms	7,636	619	0
Qwen3.5-35B-A3B	5.5	10.0	33.3%	0		1.39s	7,808	571	0

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Mistral Small 4	3.0	10.0	0.0%	0		1.72s	11,640	496	0
Qwen3.5-35B-A3B	3.0	10.0	0.0%	0		47.43s	20,739	1,833	0

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Mistral Small 4	10.0	10.0	100.0%	0		822ms	7,914	261	0
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		1.16s	7,794	243	0

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Mistral Small 4	5.3	10.0	33.3%	0		367ms	798	28	0
Qwen3.5-35B-A3B	7.7	10.0	66.7%	0		485ms	789	15	0

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Mistral Small 4	4.0	10.0	0.0%	0		729ms	519	205	0
Qwen3.5-35B-A3B	6.5	3.4	66.7%	1		1.19s	522	114	0

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Mistral Small 4	6.5	10.0	50.0%	0		380ms	729	69	0
Qwen3.5-35B-A3B	6.3	10.0	50.0%	0		809ms	711	63	0

Pemecahan teka-teki	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Mistral Small 4	3.1	9.9	0.0%	0		399ms	735	111	0
Qwen3.5-35B-A3B	3.7	7.4	22.2%	1		1.35s	714	655	0

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Mistral Small 4	10.0	10.0	100.0%	0		1.40s	6,420	213	0
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		2.30s	8,211	264	0

Pengetahuan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Mistral Small 4	3.0	10.0	0.0%	0		397ms	210	17	0
Qwen3.5-35B-A3B	3.0	10.0	0.0%	0		493ms	210	11	0

Perbandingan Cepat

Ganti Pasangan Perbandingan