领域专项 排名
看看哪些 AI 模型在 领域专项 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 指标 ↑.
316/316
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 领域专项 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #110 | Qwen3.8 2.4T A95B high | Qwen | 4.1 | 7.4 | $2.357 | 0/3 | 301.1s |
| #24 | Qwen3.7 Max medium | Qwen | 4.1 | 9.1 | $1.157 | 0/3 | 52.5s |
| #29 | Grok 4.5 high | X AI | 4.1 | 9.0 | $2.252 | 0/3 | 301.3s |
| #41 | Muse Spark 1.2 high | Meta | 4.1 | 8.7 | $1.771 | 0/3 | 108.9s |
| #77 | Gemini 3.5 Flash Lite medium | 4.1 | 7.8 | $0.272 | 0/3 | 5.34s | |
| #78 | GLM 5.2 medium | Z.ai | 4.1 | 7.8 | $0.224 | 0/3 | 45.5s |
| #86 | Seed-2.0-Code low | Bytedance Seed | 4.1 | 7.7 | $0.767 | 0/3 | 238.4s |
| #141 | Claude Fable 5.1 low | Anthropic | 4.1 | 6.9 | $2.565 | 0/3 | 19.3s |
| #156 | KAT-Coder-Pro V2.5 none | Kwaipilot | 4.1 | 6.7 | $0.487 | 0/3 | 24.9s |
| #265 | Mercury 2.5 Preview low | Inception | 4.1 | 5.0 | $0.011 | 0/3 | 836ms |
| #299 | Laguna Xs.2 medium | Poolside | 4.1 | 4.1 | $0.015 | 0/3 | 11.1s |
| #233 | Hy4 preview low | Tencent | 4.5 | 5.6 | $1.745 | 0/3 | 470.2s |
| #8 | GPT-5.6 Sol low | OpenAI | 5.3 | 9.5 | $0.357 | 1/3 | 31.0s |
| #11 | Gemini 3.5 Flash high | 5.3 | 9.4 | $2.011 | 1/3 | 17.0s | |
| #15 | GPT-5.6 Sol high | OpenAI | 5.3 | 9.4 | $0.446 | 1/3 | 37.7s |