AI BENCHY カテゴリ
反AIトリック ランキング
反AIトリック でどのAIモデルが最も強いか、どのモデルが安定しているか、差が大きいのはどこかを確認できます。 並び替え: 応答時間(平均) ↓.
| 順位 | モデル | 企業 | 反AIトリック スコア | スコア | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|
| #63 | Qwen3.5-35B-A3B none | Qwen | 3.4 | 6.1 | 0/4 | 1.43s |
| #69 | Kimi K2.6 none | Moonshot AI | 4.6 | 5.8 | 1/4 | 1.39s |
| #89 | GPT-4o-mini none | OpenAI | 4.8 | 4.9 | 1/4 | 1.34s |
| #59 | Qwen3.5-Flash none | Qwen | 3.5 | 6.2 | 0/4 | 1.32s |
| #60 | Gemma 4 26B A4B none | 8.3 | 6.2 | 3/4 | 1.28s | |
| #21 | Gemini 3 Flash Preview none | 8.3 | 8.1 | 3/4 | 1.25s | |
| #66 | GPT-5.4 none | OpenAI | 3.2 | 5.9 | 0/4 | 1.21s |
| #94 | MiMo-V2-Flash none | Xiaomi | 3.2 | 4.5 | 0/4 | 1.19s |
| #81 | Elephant medium | Openrouter | 6.6 | 5.2 | 2/4 | 1.19s |
| #96 | GPT-5.4 Nano none | OpenAI | 3.5 | 4.5 | 0/4 | 1.18s |
| #54 | Mercury 2 medium | Inception | 6.9 | 6.5 | 2/4 | 1.12s |
| #55 | MiMo-V2-Omni none | Xiaomi | 4.8 | 6.5 | 1/4 | 1.10s |
| #95 | Grok 4.1 Fast none | X AI | 3.2 | 4.5 | 0/4 | 1.07s |
| #29 | Gemini 3.1 Flash Lite Preview none | 7.5 | 7.9 | 2/4 | 1.04s | |
| #85 | Elephant none | Openrouter | 6.6 | 5.2 | 2/4 | 963ms |