给 Agent 技能写评测:从拍脑袋到可回归
我虽然看不懂代码,但我看得懂账本。在跨境生意里,所有流程到最后都要有质检——货不对板,亏的是真金白银。AI Agent 技能也一样:你今天写一个选品建议、一封开发信,调了几下提示词觉得“差不多”,明天再跑一次,它可能突然…
不是会跑就行,而是跑不坏才行
我虽然看不懂代码,但我看得懂账本。在跨境生意里,所有流程到最后都要有质检——货不对板,亏的是真金白银。AI Agent 技能也一样:你今天写一个选品建议、一封开发信,调了几下提示词觉得“差不多”,明天再跑一次,它可能突然发神经,把目标价写错、联系人忘填,你连发现都难。
技能从“个人经验”变成“团队可维护资产”,中间缺的那道墙,就是评测集(evals)。它不是考试打分,而是一组典型输入加期望产出的对照表,每次改东西跑一遍,确保不倒退。这东西不酷,但它是你以后少返工、少背锅的底线。
如果你已经用上了像 365Skill 这样带 evals 体系的 Agent 技能仓库,那你其实就在用这套机制。下面我把它掰开讲清楚:怎么建、怎么跑、怎么不让技能悄悄变差。
一个分水岭:拍脑袋 vs. 可回归
跨境卖家做图、写文案,起初都靠感觉——“这封邮件不错”,然后改了两三次,其实没人记录那些改动到底好了还是坏了。直到有一天团队抱怨转化率掉了,你才回去翻聊天记录。这种“拍脑袋模式”在 Agent 技能里特别致命,因为模型更新、提示词调参,任何小动都可能让输出离谱。
评测集的意义就是让“好不好”变得可回归。 你定义一批典型任务样本,记录期望输出或关键数据点,每改一次技能就跑一遍,看通过率。像验货那样,次次按标准走。
下面这张表把两种方式对比得更清楚:
| 维度 | 拍脑袋模式 | 评测驱动 |
|---|---|---|
| 判断标准 | 看一眼,心里觉得“还行” | 结构化通过项,机器可判断 |
| 技能改动风险 | 改完不知坏在哪 | 跑一遍看见哪些样本挂了 |
| 样本来源 | 记忆中最顺的几个例子 | 从真实历史任务中抽取,含边界异常 |
| 团队协作 | 只有原作者懂怎么调 | 评测集就是说明书,别人也能维护 |
| 退化检测 | 用户投诉后才发现 | 每次保存前自动跑,挂了不让发 |
这可不是理论,我们的 365 产品矩阵 里,技能这块就是在用 deny-by-default 的办法:评测过不去,技能不能发布。这套机制我自己团队已经在用。
落地四步:从零建起一套评测集
不用技术背景,只要你能描述“这个任务做好了是什么样”,就能做。下面是四步,配合一个实际场景:写一封针对新客户的外贸开发信,技能名就叫 dev-email。
- 抽样本(10~20 个,别只挑顺的)
从你团队过去三个月真实发出且得到回复的开发信里,挑出 10 个成功案例。再额外挑 3~5 个“难搞”的:对方公司名带特殊字符、收件人职位不明确、你想要强调某个冷门卖点。让这些成为输入。
- 定义通过标准(机器能数出来的才算)
不要写“邮件语气合适”这种主观项。用可查的: - 邮件主题包含收件人公司名 - 正文里出现我方 3 个核心卖点中的任意 2 个 - 有明确 call-to-action(如“能不能下周三 15 分钟电话”) - 不含占位符、无中文乱码 满足以上四条才算通过。
- 每次改动跑一遍评测集
不管你是换了个模型,还是把提示词里某句话改了顺序,先跑这 20 个样本。看通过率:原来 90%,现在不能低于 85%,否则找到原因再改。用最简单的表格记录:样本编号、是否通过、失败原因。
- 失败样本回填,让评测集长大
如果某个真实场景之前没覆盖,加进去。评测集会像老客户的售后记录一样,越来越厚,也越来越可靠。
常见的坑:我踩过的你不要再踩
- 样本太少或太顺:只选那些 prompt 本来就好处理的样本,评测通过率 100%,爽感十足,但上线就露怯。一定要包含边界异常,比如收件人信息缺失一半,看你技能能不能兜住。
- 通过标准太模糊:“看起来不错”这种标准没法回归测试,下周你就忘了怎么看。一定要拆成 yes/no 的条件,让别人也能执行。
- 改技能不跑评测:这是最常见的退化源头。改了提示词一个小地方,自己觉得无关紧要,结果坏了一个关键场景。必须先跑评测再发布,哪怕只有 5 个样本,也比没有强百倍。
365Skill 仓库是怎么做的
我们开源的 365Skill 仓库(Apache-2.0)里,每个技能目录都自带 evals 文件夹。以 five-step-dev 这个技能为例,它就包括:
- 一组 JSON 格式的输入样本(含公司名、产品线、已知联系人等)
- 对应的期望输出关键字段(主题、卖点、CTA 类型)
- 一个简单的检查脚本,读取输出对比,输出 pass/fail
每次修改技能,发布前必须跑过评测集,不通过就不能合并。这保证了每一个开放出来的技能都是经过实际业务验证的,不是 demo 玩具。而且评测集本身可扩展,你完全可以根据自己的行业术语、产品线,复制一份,把样本换成自己的,立马能用。
如果你已经在用 365Skill 技能库,直接看 evals 目录;如果还没开始,建议你先拿一个自己最常用的任务(比如回开发信、写 Listing)做成技能,顺手搭一个最小评测集。这件事花两小时,未来省两百小时。
常见问题
我没有历史任务记录,怎么抽样本?
可以先人工构造 5 个典型场景,包括一个完美情况、一个缺信息情况、一个带生僻字符情况。等实际跑出痕迹后,再用真实数据替换。起步样本数可以很少,关键在于有标准,而不是多全。
评测集合太耗时,值得做吗?
值得,因为一次线上故障造成的客户投诉或丢单成本,远高于你搭建评测的几小时。而且评测集是一次性投资,越用越值。你想想,外贸业务员培训新人还要做产品知识考试呢,AI 技能一样需要考核。
评测可以自动跑吗?
可以。哪怕最简单的脚本,读取输出文件,比对关键字和结构,就能给出 pass/fail。我们仓库里用的就是轻量脚本,不需要复杂框架。如果你用了 AllModelsAPI 这类多模型中转,甚至可以一键在不同模型上跑同一套评测,看哪个模型表现更好。
下一步:别让技能裸奔
不管你用不用我们的产品,先给你手头最重要的那一个 AI 技能配上评测集。花一小时抽样本、写通过条件,下周你就会发现,自己敢放心改 prompt 了,团队其他人也敢接手了。这才是生意人该有的控制感。
如果你想看实战派是怎么把评测集体系嵌入技能生命的,可以去 365Skill Agent 技能仓库 直接瞧目录结构;如果你还没让 AI 上手干活,先从我们免费的 AI 工具箱 里挑一个用起来,里面的开发信、Listing 生成器都配好了标准流程,跑出结果后,你自然会想建立自己的评测集。跑起来,比什么都强。