Navigasi
AI BENCHY
Advertise here

AI BENCHY Compare

Model yang Dibandingkan

Ringkasan

Perbandingan benchmark MiniMax M3 vs MiniMax M2.7 vs MiniMax M2.5MiniMax M3 unggul pada Skor dengan 7.6. MiniMax M2.7 unggul pada Keandalan dengan 10.0. MiniMax M2.7 memiliki Total Biaya terendah di $0.104. MiniMax M2.7 paling cepat di 38.18s.

Model yang direkomendasikan: MiniMax M3 - It has the best score here (7.6), while costing about 1.6x less than model lain dalam perbandingan ini.

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-06-12

Metrik MiniMax M3 MiniMax M3 medium Rilis: 2026-06-01 MiniMax M2.7 MiniMax M2.7 medium Rilis: 2026-03-18 MiniMax M2.5 MiniMax M2.5 medium Rilis: 2026-02-12
Skor 7.6 5.2 4.7
Peringkat #43 #134 #151
Keandalan 9.6 10.0 10.0
Konsistensi 7.9 6.8 6.5
Tes benar
Tingkat lulus per percobaan 65.1% 46.0% 46.0%
Tes tidak stabil 5 8 9
Total Run 63 63 63
Biaya per hasil 1.187 2.494 7.900
Total Biaya $0.131 $0.104 $0.303
Harga input $0.300 / 1M $0.250 / 1M $0.150 / 1M
Harga output $1.200 / 1M $1.000 / 1M $0.900 / 1M
Total token input 46,546 34,371 43,706
Token output 49,036 8,981 109,495
Token penalaran 92,543 89,812 330,814
Waktu respons (rata-rata) 68.17s 38.18s 65.37s
Waktu respons (maks) 431.03s 196.21s 251.36s
Waktu respons (total) 1363.38s 763.60s 849.76s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#43 MiniMax M3

medium
Cost
$0.012
Time
154.4s
Tokens
10,018 tok

#134 MiniMax M2.7

medium
Cost
$0.022
Time
22.8s
Tokens
9,250 tok

#151 MiniMax M2.5

medium
Invalid SVG
Cost
$0.000
Time
300.0s
Tokens
0 tok

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
MiniMax M3 5.5 3.7 66.7% 3 14.95s 2,526 874 3,414
MiniMax M2.7 7.9 6.3 83.3% 2 40.32s 654 3,010 17,716
MiniMax M2.5 7.9 6.3 83.3% 2 20.82s 612 286 45,344
Pemrograman Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
MiniMax M3 6.1 6.5 55.6% 1 144.74s 5,804 6,223 32,667
MiniMax M2.7 5.7 9.1 33.3% 0 101.89s 2,961 1,231 38,841
MiniMax M2.5 3.4 9.1 0.0% 0 188.58s 6,076 357 106,177
Gabungan Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
MiniMax M3 10.0 10.0 100.0% 0 65.30s 14,760 1,306 6,253
MiniMax M2.7 4.7 1.6 66.7% 1 41.03s 14,233 369 4,480
MiniMax M2.5 4.5 2.1 66.7% 1 60.39s 21,104 740 9,713
Parsing dan ekstraksi data Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
MiniMax M3 10.0 10.0 100.0% 0 14.92s 8,088 514 3,164
MiniMax M2.7 6.3 5.8 66.7% 1 21.95s 7,152 187 5,882
MiniMax M2.5 4.6 1.7 66.7% 2 7.48s 6,584 266 3,835
Spesifik domain Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
MiniMax M3 5.5 9.3 33.3% 0 233.13s 869 16,254 19,070
MiniMax M2.7 3.0 10.0 0.0% 0 19.00s 245 8 2,796
MiniMax M2.5 2.9 4.4 22.2% 2 237.27s 308 105,047 133,487
Kecerdasan umum Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
MiniMax M3 5.1 3.4 33.3% 1 33.25s 954 2,487 2,523
MiniMax M2.7 3.9 2.5 33.3% 1 38.70s 486 92 5,204
MiniMax M2.5 3.8 2.5 33.3% 1 6.63s 492 25 1,686
Kepatuhan instruksi Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
MiniMax M3 9.8 10.0 100.0% 0 6.14s 1,623 103 920
MiniMax M2.7 3.8 5.8 33.3% 1 12.80s 687 350 2,600
MiniMax M2.5 7.5 10.0 50.0% 0 621ms 699 156 1,495
Pemecahan teka-teki Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
MiniMax M3 7.9 9.9 66.7% 0 49.91s 2,079 11,946 13,761
MiniMax M2.7 5.9 7.2 55.6% 1 24.87s 675 362 7,840
MiniMax M2.5 5.3 7.2 44.4% 1 11.21s 495 1,069 9,605
Pemanggilan alat Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
MiniMax M3 10.0 10.0 100.0% 0 11.91s 9,168 281 555
MiniMax M2.7 4.7 1.6 66.7% 1 12.05s 7,067 304 1,001
MiniMax M2.5 10.0 10.0 100.0% 0 15.35s 7,123 269 937
Pengetahuan umum Skor Konsistensi Tingkat lulus per percobaan Tes tidak stabil Tes benar Waktu respons (rata-rata) Token input Token output Token penalaran
MiniMax M3 3.0 10.0 0.0% 0 100.80s 675 9,048 10,216
MiniMax M2.7 3.0 10.0 0.0% 0 22.77s 211 3,068 3,452
MiniMax M2.5 3.0 10.0 0.0% 0 80.79s 213 1,280 18,535

Perbandingan Cepat

Ganti Pasangan Perbandingan