AI BENCHY

AI 基准排行榜

Name: AI BENCHY 模型基准结果
Creator: AI BENCHY
License: https://aibenchy.com/methodology/

基准结果生成自 AI BENCHY 测试套件，时间：: 2026-07-02 已评估模型: 174

174/174

排名	模型	分数	公司	总成本	响应时间（平均）
#91#91	Gemma 4 31Bmedium	6.3	Google	$0.033 ↓	56.55s
查看模型卡片总测试数 21 错误测试数 7 可靠性 10.0 尝试通过率 69.8% 不稳定测试 1 输入令牌 17,957 输出令牌 22,356 推理令牌 65,726 响应时间（平均） 56.55s 响应时间（总计） 1074.41s 响应时间（最大） 437.40s API 错误: 2 超时: 2 答案错误: 2 无答案: 1 反AI技巧 : 10.0 编程 : 4.3 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 7.7 通用智能 : 10.0 指令遵循 : 10.0 谜题求解 : 9.9 工具调用 : 3.0 常识问答 : 3.0
#92#92	Qwen3.5-35B-A3Bmedium	6.3	Qwen	$0.401 ↓	72.57s
查看模型卡片总测试数 21 错误测试数 10 可靠性 10.0 尝试通过率 69.8% 不稳定测试 6 输入令牌 42,196 输出令牌 40,630 推理令牌 353,577 响应时间（平均） 72.57s 响应时间（总计） 1524.04s 响应时间（最大） 409.98s 超时: 5 无答案: 2 答案错误: 2 API 错误: 1 反AI技巧 : 10.0 编程 : 5.9 综合 : 4.7 数据解析与提取 : 7.3 领域专项 : 4.1 通用智能 : 2.8 指令遵循 : 10.0 谜题求解 : 8.2 工具调用 : 10.0 常识问答 : 3.0
#93#93	GPT-5.5none	6.3	OpenAI	$0.231	1.89s
查看模型卡片总测试数 21 错误测试数 11 可靠性 10.0 尝试通过率 54.0% 不稳定测试 3 输入令牌 34,212 输出令牌 1,971 推理令牌 0 响应时间（平均） 1.89s 响应时间（总计） 39.64s 响应时间（最大） 5.56s 答案错误: 11 反AI技巧 : 6.9 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 2.9 通用智能 : 10.0 指令遵循 : 6.2 谜题求解 : 7.7 工具调用 : 10.0 常识问答 : 3.0
#94#94	Gemini 3 PRO Previewmedium	6.2	Google	$0.385 ↑	9.05s
查看模型卡片总测试数 21 错误测试数 7 可靠性不适用尝试通过率 66.7% 不稳定测试 0 输入令牌 28,848 输出令牌 1,490 推理令牌 10,102 响应时间（平均） 9.05s 响应时间（总计） 90.53s 响应时间（最大） 26.24s API 错误: 4 答案错误: 3 反AI技巧 : 10.0 编程 : 3.0 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 10.0 指令遵循 : 9.8 谜题求解 : 10.0 工具调用 : 10.0 常识问答 : 3.0
#95#95	Seed-2.0-Litenone	6.2	Bytedance Seed	$0.019	2.49s
查看模型卡片总测试数 21 错误测试数 13 可靠性 10.0 尝试通过率 46.0% 不稳定测试 4 输入令牌 46,573 输出令牌 3,259 推理令牌 0 响应时间（平均） 2.49s 响应时间（总计） 52.26s 响应时间（最大） 6.70s 答案错误: 13 反AI技巧 : 3.0 编程 : 5.6 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 3.6 通用智能 : 10.0 指令遵循 : 10.0 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#96#96	Gemini 2.5 Flashnone	6.2	Google	$0.016	875ms
查看模型卡片总测试数 21 错误测试数 12 可靠性 10.0 尝试通过率 46.0% 不稳定测试 1 输入令牌 35,926 输出令牌 1,770 推理令牌 0 响应时间（平均） 875ms 响应时间（总计） 18.37s 响应时间（最大） 4.39s 答案错误: 12 反AI技巧 : 3.0 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.9 通用智能 : 5.0 指令遵循 : 10.0 谜题求解 : 7.7 工具调用 : 10.0 常识问答 : 3.0
#97#97	Gemini 3.1 Flash Liteminimal	6.1	Google	$0.013	1.33s
查看模型卡片总测试数 21 错误测试数 11 可靠性 10.0 尝试通过率 54.0% 不稳定测试 3 输入令牌 36,973 输出令牌 2,487 推理令牌 0 响应时间（平均） 1.33s 响应时间（总计） 27.91s 响应时间（最大） 4.49s 答案错误: 8 未遵循指令: 3 反AI技巧 : 8.3 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 2.9 通用智能 : 4.0 指令遵循 : 10.0 谜题求解 : 6.0 工具调用 : 10.0 常识问答 : 3.0
#98#98	Gemini 3.1 Flash Lite Previewhigh	6.1	Google	$2.310	68.14s
查看模型卡片总测试数 16 错误测试数 3 可靠性不适用尝试通过率 61.9% 不稳定测试 0 输入令牌 28,980 输出令牌 1,283 推理令牌 1,533,310 响应时间（平均） 68.14s 响应时间（总计） 1090.28s 响应时间（最大） 280.52s 答案错误: 2 未遵循指令: 1 反AI技巧 : 7.5 编程 : 0.0 综合 : 10.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 10.0 指令遵循 : 9.8 谜题求解 : 7.7 工具调用 : 10.0 常识问答 : 0.0
#99#99	Gemini 3.1 Flash Litenone	6.1	Google	$0.013	1.06s
查看模型卡片总测试数 21 错误测试数 12 可靠性 10.0 尝试通过率 52.4% 不稳定测试 4 输入令牌 36,710 输出令牌 2,484 推理令牌 0 响应时间（平均） 1.06s 响应时间（总计） 22.35s 响应时间（最大） 2.97s 答案错误: 11 未遵循指令: 1 反AI技巧 : 7.5 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 2.9 通用智能 : 4.0 指令遵循 : 10.0 谜题求解 : 6.3 工具调用 : 10.0 常识问答 : 3.0
#100#100	Qwen3.5-Flashnone	6.1	Qwen	$0.005 ↓	3.58s
查看模型卡片总测试数 21 错误测试数 13 可靠性 10.0 尝试通过率 39.7% 不稳定测试 1 输入令牌 46,439 输出令牌 4,276 推理令牌 0 响应时间（平均） 3.58s 响应时间（总计） 75.28s 响应时间（最大） 27.18s 答案错误: 13 反AI技巧 : 3.5 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 7.7 通用智能 : 10.0 指令遵循 : 6.3 谜题求解 : 3.1 工具调用 : 10.0 常识问答 : 3.0
#101#101	Gemma 4 31Bnone	6.1	Google	$0.004 ↓	4.05s
查看模型卡片总测试数 21 错误测试数 11 可靠性 10.0 尝试通过率 47.6% 不稳定测试 0 输入令牌 20,911 输出令牌 1,407 推理令牌 0 响应时间（平均） 4.05s 响应时间（总计） 76.87s 响应时间（最大） 26.13s 答案错误: 8 API 错误: 2 未遵循指令: 1 反AI技巧 : 6.5 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 7.7 通用智能 : 10.0 指令遵循 : 6.5 谜题求解 : 6.5 工具调用 : 3.0 常识问答 : 3.0
#102#102	Nemotron 3 Ultra 550b A55bnone	6.1	NVIDIA	$0.027 ↕	2.27s
查看模型卡片总测试数 21 错误测试数 13 可靠性 10.0 尝试通过率 44.4% 不稳定测试 2 输入令牌 43,326 输出令牌 2,138 推理令牌 0 响应时间（平均） 2.27s 响应时间（总计） 47.65s 响应时间（最大） 13.49s 答案错误: 12 未遵循指令: 1 反AI技巧 : 3.5 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 5.0 指令遵循 : 10.0 谜题求解 : 5.9 工具调用 : 10.0 常识问答 : 3.0
#103#103	Qwen3.6 Max Previewnone	6.0	Qwen	$0.075 ↓	3.30s
查看模型卡片总测试数 21 错误测试数 10 可靠性 10.0 尝试通过率 58.7% 不稳定测试 2 输入令牌 42,509 输出令牌 4,779 推理令牌 0 响应时间（平均） 3.30s 响应时间（总计） 69.40s 响应时间（最大） 20.51s 答案错误: 10 反AI技巧 : 5.2 编程 : 3.8 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 7.7 通用智能 : 4.3 指令遵循 : 9.8 谜题求解 : 10.0 工具调用 : 10.0 常识问答 : 3.0
#104#104	GLM 5none	6.0	Z.ai	$0.027 ↑	4.03s
查看模型卡片总测试数 21 错误测试数 12 可靠性 10.0 尝试通过率 44.4% 不稳定测试 1 输入令牌 37,135 输出令牌 1,989 推理令牌 0 响应时间（平均） 4.03s 响应时间（总计） 56.37s 响应时间（最大） 11.07s 答案错误: 12 反AI技巧 : 4.8 编程 : 4.0 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 3.0 通用智能 : 10.0 指令遵循 : 10.0 谜题求解 : 7.7 工具调用 : 10.0 常识问答 : 3.0
#105#105	Qwen3.6 Flashnone	6.0	Qwen	$0.015 ↓	1.60s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 33.3% 不稳定测试 0 输入令牌 50,810 输出令牌 4,164 推理令牌 0 响应时间（平均） 1.60s 响应时间（总计） 33.59s 响应时间（最大） 4.60s 答案错误: 12 未遵循指令: 1 无效工具调用: 1 反AI技巧 : 3.1 编程 : 5.4 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 10.0 指令遵循 : 6.3 谜题求解 : 3.5 工具调用 : 10.0 常识问答 : 3.0
#106#106	Qwen3.5-35B-A3Bnone	5.9	Qwen	$0.012 ↓	3.37s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 42.9% 不稳定测试 3 输入令牌 48,194 输出令牌 4,343 推理令牌 0 响应时间（平均） 3.37s 响应时间（总计） 70.75s 响应时间（最大） 47.43s 答案错误: 12 未遵循指令: 2 反AI技巧 : 3.4 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 7.7 通用智能 : 6.5 指令遵循 : 6.3 谜题求解 : 3.7 工具调用 : 10.0 常识问答 : 3.0
#107#107	Qwen3.5-27Bnone	5.9	Qwen	$0.015 ↓	1.68s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 38.1% 不稳定测试 2 输入令牌 44,478 输出令牌 3,592 推理令牌 0 响应时间（平均） 1.68s 响应时间（总计） 35.25s 响应时间（最大） 9.39s 答案错误: 12 未遵循指令: 2 反AI技巧 : 4.8 编程 : 5.8 综合 : 2.8 数据解析与提取 : 10.0 领域专项 : 3.0 通用智能 : 5.0 指令遵循 : 6.3 谜题求解 : 6.7 工具调用 : 10.0 常识问答 : 3.0
#108#108	GLM 5V Turbonone	5.9	Z.ai	$0.052	2.99s
查看模型卡片总测试数 21 错误测试数 13 可靠性 10.0 尝试通过率 38.1% 不稳定测试 0 输入令牌 37,100 输出令牌 1,766 推理令牌 0 响应时间（平均） 2.99s 响应时间（总计） 62.74s 响应时间（最大） 6.51s 答案错误: 11 未遵循指令: 2 反AI技巧 : 4.8 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.6 指令遵循 : 6.5 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#109#109	Qwen3.5 Plus 2026-02-15none	5.8	Qwen	$0.016 ↓	2.31s
查看模型卡片总测试数 21 错误测试数 12 可靠性 10.0 尝试通过率 46.0% 不稳定测试 2 输入令牌 45,864 输出令牌 2,480 推理令牌 0 响应时间（平均） 2.31s 响应时间（总计） 34.63s 响应时间（最大） 6.65s 答案错误: 12 反AI技巧 : 4.8 编程 : 4.3 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.4 指令遵循 : 10.0 谜题求解 : 7.7 工具调用 : 10.0 常识问答 : 3.0
#110#110	North Mini Codemedium	5.8	Cohere	$0.000	106.18s
查看模型卡片总测试数 21 错误测试数 12 可靠性 8.5 尝试通过率 50.8% 不稳定测试 4 输入令牌 32,891 输出令牌 424,772 推理令牌 1,021,489 响应时间（平均） 106.18s 响应时间（总计） 2229.70s 响应时间（最大） 357.05s 答案错误: 9 额外格式: 2 API 错误: 1 反AI技巧 : 8.4 编程 : 4.5 综合 : 2.8 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 5.1 指令遵循 : 9.8 谜题求解 : 3.3 工具调用 : 10.0 常识问答 : 3.0
#111#111	Owl Alphamedium	5.8	Openrouter	$0.000	11.95s
查看模型卡片总测试数 21 错误测试数 13 可靠性 10.0 尝试通过率 39.7% 不稳定测试 1 输入令牌 43,478 输出令牌 2,974 推理令牌 0 响应时间（平均） 11.95s 响应时间（总计） 250.88s 响应时间（最大） 58.63s 答案错误: 10 未遵循指令: 2 API 错误: 1 反AI技巧 : 4.8 编程 : 5.4 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.3 指令遵循 : 6.5 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#112#112	Mimo V2 PROnone	5.8	Xiaomi	$0.045 ↓	2.27s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 41.3% 不稳定测试 3 输入令牌 39,344 输出令牌 2,352 推理令牌 0 响应时间（平均） 2.27s 响应时间（总计） 45.50s 响应时间（最大） 6.58s 答案错误: 11 未遵循指令: 2 API 错误: 1 反AI技巧 : 3.5 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.3 指令遵循 : 6.5 谜题求解 : 6.0 工具调用 : 10.0 常识问答 : 3.0
#113#113	Owl Alphanone	5.8	Openrouter	$0.000	9.88s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 36.5% 不稳定测试 1 输入令牌 42,283 输出令牌 5,913 推理令牌 0 响应时间（平均） 9.88s 响应时间（总计） 207.38s 响应时间（最大） 47.10s 答案错误: 10 未遵循指令: 3 额外格式: 1 反AI技巧 : 3.4 编程 : 5.6 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.3 指令遵循 : 6.4 谜题求解 : 5.4 工具调用 : 10.0 常识问答 : 3.0
#114#114	Kimi K2.6none	5.8	Moonshot AI	$0.078 ↓	13.27s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 36.5% 不稳定测试 2 输入令牌 32,916 输出令牌 16,410 推理令牌 0 响应时间（平均） 13.27s 响应时间（总计） 278.57s 响应时间（最大） 238.89s 答案错误: 11 未遵循指令: 3 反AI技巧 : 4.6 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 5.4 指令遵循 : 6.5 谜题求解 : 3.1 工具调用 : 10.0 常识问答 : 3.0
#115#115	GPT-5.4none	5.8	OpenAI	$0.122	1.42s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 36.5% 不稳定测试 2 输入令牌 34,212 输出令牌 2,417 推理令牌 0 响应时间（平均） 1.42s 响应时间（总计） 29.87s 响应时间（最大） 2.95s 答案错误: 13 未遵循指令: 1 反AI技巧 : 3.2 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.4 指令遵循 : 6.5 谜题求解 : 5.6 工具调用 : 10.0 常识问答 : 3.0
#116#116	Qwen3.6 Plus Previewmedium	5.8	Qwen	$0.000	15.25s
查看模型卡片总测试数 19 错误测试数 10 可靠性不适用尝试通过率 42.9% 不稳定测试 0 输入令牌 32,639 输出令牌 1,153 推理令牌 62,197 响应时间（平均） 15.25s 响应时间（总计） 182.96s 响应时间（最大） 43.55s API 错误: 8 答案错误: 2 反AI技巧 : 8.3 编程 : 9.8 综合 : 10.0 数据解析与提取 : 10.0 领域专项 : 3.0 通用智能 : 3.0 指令遵循 : 6.5 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#117#117	Mimo V2 Omninone	5.7	Xiaomi	$0.021 ↓	2.44s
查看模型卡片总测试数 21 错误测试数 13 可靠性 10.0 尝试通过率 39.7% 不稳定测试 1 输入令牌 40,852 输出令牌 3,314 推理令牌 0 响应时间（平均） 2.44s 响应时间（总计） 48.81s 响应时间（最大） 6.81s 答案错误: 10 API 错误: 1 额外格式: 1 未遵循指令: 1 反AI技巧 : 3.6 编程 : 4.4 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.1 指令遵循 : 6.5 谜题求解 : 10.0 工具调用 : 10.0 常识问答 : 3.0
#118#118	Claude Sonnet 5none	5.7	Anthropic	$0.287	4.74s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 42.9% 不稳定测试 4 输入令牌 76,797 输出令牌 13,325 推理令牌 0 响应时间（平均） 4.74s 响应时间（总计） 99.46s 响应时间（最大） 29.46s 答案错误: 7 额外格式: 4 无答案: 2 未遵循指令: 1 反AI技巧 : 5.3 编程 : 4.6 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.7 指令遵循 : 6.4 谜题求解 : 6.0 工具调用 : 10.0 常识问答 : 3.0
#119#119	Grok 4.1 Fastmedium	5.6	X AI	$0.069 ↑	23.85s
查看模型卡片总测试数 19 错误测试数 10 可靠性 10.0 尝试通过率 55.6% 不稳定测试 6 输入令牌 42,845 输出令牌 2,006 推理令牌 96,334 响应时间（平均） 23.85s 响应时间（总计） 286.16s 响应时间（最大） 121.79s 未遵循指令: 4 答案错误: 4 无答案: 1 超时: 1 反AI技巧 : 8.7 编程 : 7.8 综合 : 10.0 数据解析与提取 : 10.0 领域专项 : 5.8 通用智能 : 4.2 指令遵循 : 6.5 谜题求解 : 5.3 工具调用 : 2.8 常识问答 : 3.0
#120#120	GLM 5.1none	5.6	Z.ai	$0.063 ↑	4.10s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 41.3% 不稳定测试 4 输入令牌 47,133 输出令牌 3,754 推理令牌 0 响应时间（平均） 4.10s 响应时间（总计） 86.18s 响应时间（最大） 32.57s 答案错误: 13 无效工具调用: 1 反AI技巧 : 4.0 编程 : 3.9 综合 : 2.8 数据解析与提取 : 10.0 领域专项 : 2.9 通用智能 : 5.0 指令遵循 : 9.8 谜题求解 : 7.7 工具调用 : 10.0 常识问答 : 3.0

←

1 2 3 4 5 6

→

快速对比

Gemini 3.5 FlashhighvsGemini 3 Flash Previewmedium Gemini 3.5 FlashhighvsQwen3.7 Maxmedium Gemini 3.5 FlashhighvsGPT-5.5low Gemini 3.5 FlashhighvsGemini 3.5 Flashlow Gemini 3.5 FlashhighvsClaude Fable 5medium Gemini 3.5 FlashhighvsGemini 3.1 Pro Previewmedium Gemini 3.5 FlashhighvsNemotron 3 Ultra 550b A55bmedium免费可用 Gemini 3.5 FlashhighvsNorth Mini Codemedium免费可用 Gemini 3 Flash PreviewmediumvsQwen3.7 Maxmedium Qwen3.7 MaxmediumvsGPT-5.5low GPT-5.5lowvsGemini 3.5 Flashlow Gemini 3.5 FlashlowvsClaude Fable 5medium

AI 基准排行榜

筛选模型

快速对比