谜题求解 排名
看看哪些 AI 模型在 谜题求解 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 测试正确 ↑.
216/216
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 谜题求解 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #111 | Gemini 3.1 Flash Lite low | 10.0 | 6.5 | $0.621 | 3/3 | 1.40s | |
| #112 | Gemini 3.1 Flash Lite Preview none | 10.0 | 6.4 | $0.052 | 3/3 | 900ms | |
| #116 | Gemma 4 31B medium | 9.9 | 6.3 | $0.107 | 3/3 | 26.9s | |
| #137 | Grok 4.20 Beta medium | X AI | 10.0 | 6.0 | $0.750 | 3/3 | 3.52s |
| #139 | Gemini 3 PRO Preview medium | 10.0 | 6.0 | $0.385 | 3/3 | 3.88s | |
| #163 | Mimo V2 Omni none | Xiaomi | 10.0 | 5.5 | $0.021 | 3/3 | 1.16s |