指示追従 ランキング
指示追従 でどのAIモデルが最も強いか、どのモデルが安定しているか、差が大きいのはどこかを確認できます。 並び替え: 正解テスト ↓.
316/316
モデルを絞り込む
現在の検索条件とフィルターに一致するモデルはありません。
| 順位 | モデル | 企業 | 指示追従 スコア | スコア | 合計コスト | 正解テスト | 応答時間(平均) |
|---|---|---|---|---|---|---|---|
| #279 | KAT-Coder-Air V2.5 none | Kwaipilot | 9.9 | 4.8 | $0.070 | 2/2 | 1.75s |
| #282 | Hunter Alpha medium | OpenRouter | 9.9 | 4.7 | $0.000 | 2/2 | 4.18s |
| #284 | Laguna M.1 medium | Poolside | 10.0 | 4.7 | $0.033 | 2/2 | 4.30s |
| #285 | Cobuddy medium | Baidu | 9.8 | 4.7 | $0.000 | 2/2 | 11.6s |
| #293 | Elephant Alpha none | Openrouter | 9.8 | 4.3 | $0.000 | 2/2 | 1.03s |
| #295 | Elephant Alpha medium | Openrouter | 9.8 | 4.3 | $0.000 | 2/2 | 987ms |
| #299 | Laguna Xs.2 medium | Poolside | 10.0 | 4.1 | $0.015 | 2/2 | 1.68s |
| #305 | Grok Build 0.1 none | X AI | 9.8 | 4.0 | $0.547 | 2/2 | 7.36s |
| #312 | gpt-oss-120b none | OpenAI | 9.8 | 3.7 | $0.010 | 2/2 | 5.06s |
| #315 | Step 3.5 Flash none | Stepfun | 5.0 | 2.3 | $0.020 | 1/1 | 9.30s |
| #31 | Muse Spark 1.3 high | Meta | 6.5 | 8.9 | $1.653 | 1/2 | 14.7s |
| #43 | Muse Spark 1.1 medium | Meta | 6.5 | 8.6 | $1.420 | 1/2 | 6.31s |
| #56 | Muse Spark 1.1 low | Meta | 7.3 | 8.3 | $0.673 | 1/2 | 5.42s |
| #57 | Claude Fable 5.1 medium | Anthropic | 7.3 | 8.3 | $2.909 | 1/2 | 5.77s |
| #63 | Muse Glimmer 30B xhigh | Meta | 8.4 | 8.1 | $0.471 | 1/2 | 8.90s |