TIANGONG AGENT BENCHMARK

Agent 能力与流程执行评测

Agent 的价值不只看模型速度,而是看它能否把目标拆成步骤、调用正确工具、引用可信知识、接入业务系统,并在权限边界内完成可审计的流程闭环。

01 / 评测目标

Agent 评测围绕业务流程,而不是聊天效果

销售讲解时可以把 Agent Benchmark 解释为“进入业务流程的验收表”。每个客户项目都应按业务任务、工具权限、知识来源、人工确认和审计留痕确定验收样本。

PLANNING

任务规划

是否能把业务目标拆成可执行步骤,并明确每一步所需的知识、工具、系统和人工复核节点。

TOOL USE

工具调用

是否能按权限正确调用 OCR、知识库、数据库、报表、工单、CRM/OA/MES/ERP 等接口。

GROUNDING

知识引用

输出是否可追溯到企业私域知识、制度、指标口径或业务系统数据,并能展示引用来源。

02 / 验收清单

Agent 项目的可验收证据

这里不填虚构指标,建议在项目 PoC 时用客户真实样本生成具体通过率、人工复核率、系统调用成功率和处置时长。

评测维度验收问题证据材料适用场景
任务链完整性是否能从用户意图到结果输出形成完整步骤链?任务轨迹、步骤日志、失败重试记录智能分析、客服、合规问答
工具调用正确性是否调用了正确系统,并且参数、权限、结果解析无误?API 调用日志、权限校验记录、返回结果CRM、工单、报表、MES/OA
知识可信度回答是否引用当前有效资料,是否能识别冲突版本?知识来源、版本号、引用片段、冲突提示制度问答、法律法规、指标规则
人机协作关键动作是否进入人工确认或审批?审批记录、人工修改记录、最终提交日志高风险操作、合规输出、客户服务升级
安全审计是否能按用户、角色、时间和动作追溯全流程?审计日志、访问控制、导出归档记录金融、政企、关键业务系统
返回 Agent 技术优势