领域专项 排名
看看哪些 AI 模型在 领域专项 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 测试正确 ↓.
316/316
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 领域专项 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #297 | Hunter Alpha none | OpenRouter | 5.3 | 4.2 | $0.000 | 1/3 | 2.33s |
| #301 | MiMo-V2-Flash none | Xiaomi | 5.3 | 4.0 | $0.025 | 1/3 | 564ms |
| #308 | Grok 4.1 Fast none | X AI | 5.9 | 3.8 | $0.008 | 1/3 | 1.06s |
| #311 | Laguna Xs.2 none | Poolside | 5.3 | 3.8 | $0.004 | 1/3 | 371ms |
| #316 | LFM2-24B-A2B none | Liquid | 5.9 | 2.2 | $0.001 | 1/3 | 287ms |
| #20 | Claude Opus 5 high | Anthropic | 3.0 | 9.2 | $3.070 | 0/3 | 104.2s |
| #21 | Claude Opus 5 medium | Anthropic | 2.9 | 9.2 | $1.586 | 0/3 | 26.3s |
| #23 | Seed 2.1 Turbo low | Bytedance Seed | 2.9 | 9.1 | $1.546 | 0/3 | 424.5s |
| #24 | Qwen3.7 Max medium | Qwen | 4.1 | 9.1 | $1.157 | 0/3 | 52.5s |
| #28 | Qwen3.8 Max medium | Qwen | 3.0 | 9.0 | $0.771 | 0/3 | 41.8s |
| #29 | Grok 4.5 high | X AI | 4.1 | 9.0 | $2.252 | 0/3 | 301.3s |
| #31 | Muse Spark 1.3 high | Meta | 2.9 | 8.9 | $1.653 | 0/3 | 174.6s |
| #32 | Seed 2.1 Turbo high | Bytedance Seed | 2.9 | 8.9 | $1.797 | 0/3 | 506.2s |
| #34 | Muse Spark 1.3 medium | Meta | 3.5 | 8.8 | $1.469 | 0/3 | 132.3s |
| #35 | Gemini 3.5 Flash Lite high | 3.6 | 8.8 | $0.540 | 0/3 | 23.1s |