Agent 的表现不只由模型能力决定。技能指令写得含糊、工具描述不准确、系统规则互相冲突,都可能让同一个模型表现变差。
Hermes 的自进化先把这些上下文文本当成可测试对象,用打分、改写、择优构成优化循环。
这篇只回答一个问题:除了训练模型,Agent 还能怎样系统性提升表现?
Hermes 给出的答案是:把模型接收的技能、工具描述和系统提示词视为可评估文本,通过生成数据、建立基线、变异、评分与择优循环优化,再对高风险代码设置更严格门控。
先区分模型能力与上下文质量
强化学习修改模型参数,成本高、周期长。技能、工具描述和系统提示词同样直接影响行为,却可以通过文本修改立即生效。
自进化关注等号右侧的上下文质量。它不是让 Agent 在运行中自行改代码,而是在开发阶段用可重复评估选择更好的文本版本。
七步管线让改写可以比较
管线不是从“让模型重写一遍”开始,而是依次完成七步:
- 选择需要改进的 Skill、工具描述或 Prompt section。
- 构建评估数据集,并拆分 train、validation 和 holdout。
- 评估当前版本,得到可以比较的 baseline。
- 检查当前版本是否满足大小、结构等约束。
- 多轮执行“收集反馈 → 针对性改写 → 评分 → 择优”。
- 用约束和 holdout 重新验证进化版本。
- 备份并写入选中的版本,让后续会话使用新内容。
其中第 2–4 步属于度量体系,第 5–7 步属于优化与部署。没有 baseline 与同一测试集,“改得更好”只是主观感觉;没有约束和 holdout,局部分数提升也可能来自文本膨胀或过拟合。
四层进化为什么不能同时开放
第一层是 Skill 文件。它范围小、容易单独测试、失败影响局部,原材料明确这一阶段已经实现。
第二层是工具描述。描述会影响模型选择哪个工具,但每次调用都会携带全部 schema,因此还要限制长度。第三层是 system prompt section,它影响所有会话,需要更严格的增长限制和 benchmark 回归。第四层才是工具实现代码,必须保持函数签名与注册方式,并通过全量测试。
四层共享“生成数据 → 建立基线 → 产生候选 → 重新评估 → 择优保存”的管线,但风险门槛不同。原材料把第二至第四层标为计划中,不能因为整体架构已经画出,就把它们描述成已交付能力。
Hermes 将自进化放在独立仓库,以开发工具的方式输出文件和 Git PR。这个设计把 自动优化 与 人工合并上线 分开,避免用户对话直接改写正在运行的 Agent。
三个容易走偏的地方
- 把自进化理解为 Agent 在用户对话中自动改写自身代码。
- 没有量化基线就凭感觉修改 Skill,无法判断是否退化。
- 把计划中的工具描述、系统提示词和代码进化描述成已实现能力。
产品经理可以怎样评审
评审这项能力,可以先检查三条:
- 先优化低风险、可独立评估的文本对象,再扩大到全局规则和代码。
- 任何进化都要同时有质量指标、硬约束和回归数据。
- 候选生成、择优、保存和上线是四个不同状态,不能自动串联。
原材料给出的约 2–10 美元成本属于其描述,缺少环境和日期细节;正文不将其作为当前普遍价格承诺。
