记录 Execution Trajectory
保留计划、Context、模型与工具调用、状态、人工判断和最终结果,形成完整运行证据。
企业级智能体基础 · Agent Reliability & Evaluation
让每一次运行可观察、可评测,也推动下一次改进。
围绕完整任务记录计划、Context、模型与工具调用、状态变化、人工判断和业务结果,从真实失败中形成评测维度、黄金样例与回归门槛,再把验证后的改进带回模型、Context、Skills 和运行策略。
运行机制
评测维度不应只由预设基准产生,也要从完整 Execution Trajectory 中持续发现新失败,再由领域专家建立判据并校准自动评估。
保留计划、Context、模型与工具调用、状态、人工判断和最终结果,形成完整运行证据。
从真实运行记录中发现异常,合并为失败维度,并由领域专家建立判据与黄金样例。
用人工判定的黄金样例对齐自动评估,对机器无法稳定判断的新型或主观失败保留人工复核。
模型、Context、Skills 或系统变更后重跑关键任务,只有通过门槛的改进才能进入生产。
技术工件 · Evaluation System
可靠性不是一个总分,而是一组相互连接的工件:运行轨迹提供证据,失败分类定义问题,黄金样例校准判断,回归门槛控制变更。
记录一次任务完整经过,而不是只保留最终回答。
从真实异常中形成可复现、可归因的失败维度。
以领域专家判例对齐自动评估,并持续吸收新型失败。
在基础模型、Skills 或系统变化后保护已经验证的能力。
生产中的作用
把关键任务、失败条件与人工复核标准转化为可重复的上线检查,而不是依赖演示效果。
通过 Execution Trajectory 区分模型、Context、Harness、Skill、工具或流程问题,缩短排查与修复路径。
基础模型、Skills 或系统变化后回归关键任务,确认改进不是以其他能力退化为代价。
验证与边界
自动评测可以扩大覆盖,但新的失败类型、主观质量和高风险结果仍需要领域专家定义标准、校准 Evaluator 并保留责任边界。业务结果用于验证评测是否真正代表价值,而不是替代专业判断。
衡量方式
任务级成功率
Evaluator 与人工一致性
关键任务回归通过率
失败恢复成功率
边界与护栏
区分模型输出、步骤正确性、任务完成与业务结果,避免单一指标替代完整判断。
由领域专家建立黄金样例、处理新失败类型,并复核高风险或主观结果。
清楚区分已运行的数据回流与人工迭代,以及仍在持续工程化的自动评测能力。
协同技术
模型、Context、运行时与企业级基础彼此连接,才让智能体从理解走向可靠行动。
技术问题
离线评测用于稳定复现关键任务与已知失败,线上结果则检验系统在真实环境中的完成质量和业务影响。两者需要通过同一任务定义与运行记录关联,避免离线分数提高却没有带来真实改进。
先基于完整运行记录确认失败原因和责任边界,再由领域专家整理为可复现任务、期望行为与判定标准。案例应按场景和版本管理,进入后续模型、Skills、Context 与流程变更的回归测试。
需要固定任务定义、Context 快照、工具环境和判定标准,并同时记录质量、成本、时延、人工介入与失败恢复。只有在相同条件下完成多次运行,才能区分稳定改进与偶然成功。