老金出海AI · GO GLOBAL
返回列表
给 Agent 技能写评测:从拍脑袋到可回归
Agent 技能发布于 2026年8月6日·7 分钟阅读

给 Agent 技能写评测:从拍脑袋到可回归

我虽然看不懂代码,但我看得懂账本。在跨境生意里,所有流程到最后都要有质检——货不对板,亏的是真金白银。AI Agent 技能也一样:你今天写一个选品建议、一封开发信,调了几下提示词觉得“差不多”,明天再跑一次,它可能突然…


不是会跑就行,而是跑不坏才行

我虽然看不懂代码,但我看得懂账本。在跨境生意里,所有流程到最后都要有质检——货不对板,亏的是真金白银。AI Agent 技能也一样:你今天写一个选品建议、一封开发信,调了几下提示词觉得“差不多”,明天再跑一次,它可能突然发神经,把目标价写错、联系人忘填,你连发现都难。

技能从“个人经验”变成“团队可维护资产”,中间缺的那道墙,就是评测集(evals)。它不是考试打分,而是一组典型输入加期望产出的对照表,每次改东西跑一遍,确保不倒退。这东西不酷,但它是你以后少返工、少背锅的底线。

如果你已经用上了像 365Skill 这样带 evals 体系的 Agent 技能仓库,那你其实就在用这套机制。下面我把它掰开讲清楚:怎么建、怎么跑、怎么不让技能悄悄变差。

一个分水岭:拍脑袋 vs. 可回归

跨境卖家做图、写文案,起初都靠感觉——“这封邮件不错”,然后改了两三次,其实没人记录那些改动到底好了还是坏了。直到有一天团队抱怨转化率掉了,你才回去翻聊天记录。这种“拍脑袋模式”在 Agent 技能里特别致命,因为模型更新、提示词调参,任何小动都可能让输出离谱。

评测集的意义就是让“好不好”变得可回归。 你定义一批典型任务样本,记录期望输出或关键数据点,每改一次技能就跑一遍,看通过率。像验货那样,次次按标准走。

下面这张表把两种方式对比得更清楚:

维度拍脑袋模式评测驱动
判断标准看一眼,心里觉得“还行”结构化通过项,机器可判断
技能改动风险改完不知坏在哪跑一遍看见哪些样本挂了
样本来源记忆中最顺的几个例子从真实历史任务中抽取,含边界异常
团队协作只有原作者懂怎么调评测集就是说明书,别人也能维护
退化检测用户投诉后才发现每次保存前自动跑,挂了不让发

这可不是理论,我们的 365 产品矩阵 里,技能这块就是在用 deny-by-default 的办法:评测过不去,技能不能发布。这套机制我自己团队已经在用。

落地四步:从零建起一套评测集

不用技术背景,只要你能描述“这个任务做好了是什么样”,就能做。下面是四步,配合一个实际场景:写一封针对新客户的外贸开发信,技能名就叫 dev-email

  1. 抽样本(10~20 个,别只挑顺的)

从你团队过去三个月真实发出且得到回复的开发信里,挑出 10 个成功案例。再额外挑 3~5 个“难搞”的:对方公司名带特殊字符、收件人职位不明确、你想要强调某个冷门卖点。让这些成为输入。

  1. 定义通过标准(机器能数出来的才算)

不要写“邮件语气合适”这种主观项。用可查的: - 邮件主题包含收件人公司名 - 正文里出现我方 3 个核心卖点中的任意 2 个 - 有明确 call-to-action(如“能不能下周三 15 分钟电话”) - 不含占位符、无中文乱码 满足以上四条才算通过。

  1. 每次改动跑一遍评测集

不管你是换了个模型,还是把提示词里某句话改了顺序,先跑这 20 个样本。看通过率:原来 90%,现在不能低于 85%,否则找到原因再改。用最简单的表格记录:样本编号、是否通过、失败原因。

  1. 失败样本回填,让评测集长大

如果某个真实场景之前没覆盖,加进去。评测集会像老客户的售后记录一样,越来越厚,也越来越可靠。

常见的坑:我踩过的你不要再踩

  • 样本太少或太顺:只选那些 prompt 本来就好处理的样本,评测通过率 100%,爽感十足,但上线就露怯。一定要包含边界异常,比如收件人信息缺失一半,看你技能能不能兜住。
  • 通过标准太模糊:“看起来不错”这种标准没法回归测试,下周你就忘了怎么看。一定要拆成 yes/no 的条件,让别人也能执行。
  • 改技能不跑评测:这是最常见的退化源头。改了提示词一个小地方,自己觉得无关紧要,结果坏了一个关键场景。必须先跑评测再发布,哪怕只有 5 个样本,也比没有强百倍。

365Skill 仓库是怎么做的

我们开源的 365Skill 仓库(Apache-2.0)里,每个技能目录都自带 evals 文件夹。以 five-step-dev 这个技能为例,它就包括:

  • 一组 JSON 格式的输入样本(含公司名、产品线、已知联系人等)
  • 对应的期望输出关键字段(主题、卖点、CTA 类型)
  • 一个简单的检查脚本,读取输出对比,输出 pass/fail

每次修改技能,发布前必须跑过评测集,不通过就不能合并。这保证了每一个开放出来的技能都是经过实际业务验证的,不是 demo 玩具。而且评测集本身可扩展,你完全可以根据自己的行业术语、产品线,复制一份,把样本换成自己的,立马能用。

如果你已经在用 365Skill 技能库,直接看 evals 目录;如果还没开始,建议你先拿一个自己最常用的任务(比如回开发信、写 Listing)做成技能,顺手搭一个最小评测集。这件事花两小时,未来省两百小时。

常见问题

我没有历史任务记录,怎么抽样本?

可以先人工构造 5 个典型场景,包括一个完美情况、一个缺信息情况、一个带生僻字符情况。等实际跑出痕迹后,再用真实数据替换。起步样本数可以很少,关键在于有标准,而不是多全。

评测集合太耗时,值得做吗?

值得,因为一次线上故障造成的客户投诉或丢单成本,远高于你搭建评测的几小时。而且评测集是一次性投资,越用越值。你想想,外贸业务员培训新人还要做产品知识考试呢,AI 技能一样需要考核。

评测可以自动跑吗?

可以。哪怕最简单的脚本,读取输出文件,比对关键字和结构,就能给出 pass/fail。我们仓库里用的就是轻量脚本,不需要复杂框架。如果你用了 AllModelsAPI 这类多模型中转,甚至可以一键在不同模型上跑同一套评测,看哪个模型表现更好。

下一步:别让技能裸奔

不管你用不用我们的产品,先给你手头最重要的那一个 AI 技能配上评测集。花一小时抽样本、写通过条件,下周你就会发现,自己敢放心改 prompt 了,团队其他人也敢接手了。这才是生意人该有的控制感。

如果你想看实战派是怎么把评测集体系嵌入技能生命的,可以去 365Skill Agent 技能仓库 直接瞧目录结构;如果你还没让 AI 上手干活,先从我们免费的 AI 工具箱 里挑一个用起来,里面的开发信、Listing 生成器都配好了标准流程,跑出结果后,你自然会想建立自己的评测集。跑起来,比什么都强。