AI BENCHY
Advertise here

AI BENCHY 失敗分析

余分な書式 の失敗

どのAIモデルで 余分な書式 が起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。

表示モデル数

14

総失敗数

48

最も影響を受けたモデル

Claude Opus 4.6 5
順位 モデル 企業 余分な書式 件数 スコア 正解テスト 応答時間(平均)
#65 Grok 4.20 medium X AI 1 7.1 12/21 27.7s
#67 MiniMax M3 medium Minimax 1 7.1 11/21 68.2s
#79 Hunter Alpha medium OpenRouter 1 6.7 8/18 10.3s
#80 Mimo V2 Omni medium Xiaomi 1 6.7 10/21 41.2s
#101 Mimo V2 Omni none Xiaomi 1 6.0 8/21 2.44s
#113 DeepSeek V4 Pro none DeepSeek 1 5.7 7/21 12.4s
#121 Owl Alpha none Openrouter 1 5.5 7/21 9.88s
#127 Grok 4.20 none X AI 1 5.4 6/18 1.11s
#140 Qwen3 Coder Next none Qwen 1 4.9 5/21 8.62s
#143 MiMo-V2.5 none Xiaomi 1 4.9 5/21 2.20s
#152 MiMo-V2-Flash none Xiaomi 1 4.6 4/21 2.76s
#156 Hy3 preview none Tencent 1 4.4 4/21 12.9s
#161 Qwen3.5-9B medium Qwen 1 4.2 3/21 82.2s
#163 Granite 4.1 8B none IBM Granite 1 4.0 2/21 728ms

余分な書式 件数 上位モデル

余分な書式 件数 対 スコア

応答時間(平均) 上位モデル