一次装了 5 个 skill 后,我的 AI Agent 开始自己进化了

上周末给 Hermes Agent 一次性装了 5 个社区 skill。本来只想试试哪个好用,结果发现这 5 个东西拼在一起,Agent 的自我进化飞轮第一次完整转了起来。

5 分钟,5 个 skill

三个 git clone + bash install.sh,一个 cp -r 34 个插件目录,一个 pip install + activate:

skill 类型 干什么
hermes-dojo 自改进道场 扫描会话找弱点,自动创建或 patch skill
skill-factory 技能工厂 后台观察工作流,自动提案生成可复用 skill
super-hermes 元推理棱镜 让 Agent 用不同认知透镜分析问题,并报告自己漏了什么
scope-recall 实时记忆 每轮对话自动捕获,每 2 小时 LLM 消化成结构化记忆
42-evey/hermes-plugins 34 插件套装 后台零感知运行:自主决策、成本控制、幻觉检测、Claude Code 桥接

装完重启网关,开始挨个试。

Dojo:它会看病了

先跑 /dojo analyze。扫描了最近 7 天 63 个 session,2225 次工具调用:

总体成功率: 86.8%

最弱环节:
  skill_view     50.8% (31/63 失败) — skill 文件大/超时
  process        52.0%  后台进程正常超时
  cronjob        53.8%  微信 iLink 限速

技能缺口:
  database-operations  被请求 32 次,没 skill
  api-integration      被请求 15 次,没 skill

然后 /dojo improve。Dojo 自动创建了两个新 skill:database-operations(SQLite 路径速查、常用查询、scope-recall 表结构)和 api-integration(密钥分布、端点配置、scope-recall LLM 配置避坑)。最后设了每天早上 6 点自动跑改进——Agent 在睡着的时候自己看病、自己修。

Skill Factory:它会造 skill 了

这个是最诡异的。Skill Factory 挂在后台完全不吭声,我正常干了一天活:装 scope-recall、修 digest 报错、写博文、搭 cron 每日监控页。会话结束时它弹了:

🏭 SKILL FACTORY — 检测到可封装模式

Proposed Skill: skill-install-from-github
「你今天重复了 5 次从 GitHub 克隆→判断类型→安装→验证的流程」

Proposed Skill: scope-recall-config-debug
「digest 报错→查 journal_extractors.py→api_key_env 数组被 str() 强转→修复」

两个提案都是从本轮对话里捕获的。一键生成完整的 SKILL.md——含触发条件、操作步骤、常见坑点。不需要你写 skill,正常干活它看着就学会了。

Super-hermes:它会反思了

最后试了 prism-full——多轮分析 + 对抗审查。让 Agent 对自己这段对话做一个完整的结构分析,然后攻击自己的结论。

Phases 1 设计了 3 个分析透镜:因果链、效率经济、架构一致性。Phases 2 多轮执行后,Phase 2.5 是对抗 pass——「攻击你刚才的每一条发现」。结果揪出了一个我自己没意识到的盲区:

建 cron 每日监控页时,我用了 Jinja2 模板的 namespace.append 来构建分组列表。直接 500 error。对抗 pass 直接指出来:「你宣称架构一致性是核心工程方法——建 cron 页面时参考了 fundtracker、demo 页、base_layout 的结构,但这一步你没先查 Jinja2 是否支持 namespace.append。这恰恰违背了你自己宣称的原则。」

这就是 prism-reflect 的核心价值——不是分析代码,是分析分析者自己。

scope-recall:最深的整合

scope-recall 是这 5 个里最重的——它不是一个装完就完的 skill,而是一个独立的记忆提供者,有自己的 SQLite 数据库、配置面板、背景消化管线。

装好后第一步:接入 HexaMind 七层记忆系统,成为 L0(实时捕获层)。做了一套完整的架构整合:重写 HexaMind skill 从 v1 到 v2.0,hexamind_search.py 支持 L0+L1+L3 七层检索,hexamind_maintenance.py 统一维护入口。scope-recall 自带配置面板,可以可视化配置 capture LLM 模型和 journal digest 参数。

第二步:打通。日志显示 digest 连续 3 次报错——LLM extraction failed (unknown)。排查了两小时,走了一遍完整的排障链路:

  1. 查 scope-recall 的 config.json——发现是空的 {},默认 model 指向 OpenAI 的 gpt-4o-mini
  2. 写 DeepSeek 配置(model、base_url、api_key_env),重启 → 还是 error
  3. 翻源码 journal_extractors.py 第 246 行——api_key_envstr() 强转,传数组 ["DEEPSEEK_API_KEY"] 会变成字面量 "['DEEPSEEK_API_KEY']",没有这个环境变量
  4. 改成裸字符串 "DEEPSEEK_API_KEY",加 key 到 .env,重启

第二条 digest 立刻跑通了。第一条自动提取的记忆从 journal 里生成出来——"在 Hermes 环境中,无法从网关内部执行 restart 命令,需通过外部终端或 systemd 用户服务重启"。自动分类为 ops

现在 L0 积累的实时数据:10 条结构化记忆,464 条 journal entries,每条都是从对话里自动提取的。

evey-plugins:沉默的底座

前面四个 skill 有个共同点:都需要你主动触发。Dojo 要你敲 /dojo analyze,Skill Factory 要你敲 /skill-factory propose,prism 要你喊,scope-recall 虽然每轮自动记但要你去排查 digest 报错。

唯独 evey 不一样——34 个插件装上后零感知运行,没有命令、没有界面、没有输出。但它是让整个飞轮可持续运转的底座。

挑几个关键的:

自主决策层evey-autonomy 是核心引擎,autonomous_decideautonomous_planautonomous_reflect 三个工具构成完整的自主决策闭环。Dojo 说"Agent 应该创建这个 skill"的时候,是 evey-autonomy 在执行。evey-council 在关键决策时启动 3 模型辩论——三个不同的模型各自给出方案,取共识。不是拍脑袋,是投票。

质量护栏evey-validate 对每次输出做幻觉检测,0-10 打分。低分输出会被拦截,不会变成沉淀到 L0 的"知识"。evey-reflect 在输出前用廉价模型自我纠错。evey-sandbox 给代码执行加资源限制,防止跑飞。

成本控制evey-cost-guard 通过 Langfuse 追踪每日和每个任务的费用,80% 告警,100% 阻断。Dojo 在凌晨 6 点自动跑改进的时候,如果成本超预算,evey-cost-guard 会直接停掉——不会让一个自动 cron 烧掉一个月的 API 额度。

记忆管理evey-memory-adaptive 对每条记忆做重要性评分加上时间衰减,高分记忆持久、低分记忆自然淘汰。evey-memory-consolidate 定期把碎片化记忆固化到 MEMORY.md。scope-recall 负责"记住什么",这两个负责"忘掉什么"——没有遗忘机制的记忆系统会变成垃圾堆。

跨 Agent 协作evey-bridge 建立与 Claude Code 的双向文件通信。当一个任务需要两边的能力时,不用人工搬运上下文。

这 34 个插件的共同逻辑是:让 Agent 的自主行为变得可持续。没有成本控制,自动 cron 烧光预算;没有幻觉检测,错误是事实被固化为知识;没有记忆衰减,知识库膨胀成噪音。前四个 skill 让 Agent 有了自我进化的能力,evey 让这个进化不会失控。

飞轮成型

回头看,装这 5 个 skill 最大的收获不是 5 个功能点了,而是把飞轮拼起来了:

装 skill → 用 → 发现问题 → 修 → 沉淀为 skill → 自动 cron
                │
                └── 同时被 skill-factory 观察 → 生成新 skill
                                          │
                                          └── 再被 dojo 分析和改进

一次对话的实际产出:

从哪来 产出了什么
Dojo improve database-operationsapi-integration 两个 skill
Skill Factory skill-install-from-githubscope-recall-config-debug 两个 skill
prism-full 发现 Jinja2 namespace.append 盲区
scope-recall HexaMind v2.0 L0 实时记忆,digest 排障链路打通
evey-plugins 34 插件静默底座:成本控制、幻觉检测、记忆衰减、多 Agent 协作
整体 86.8% 基线,6am 自动改进 cron

装之前,Agent 靠我写 skill。装之后,Agent 自己发现自己缺什么 skill、自己造 skill、自己改进 skill、自己定时跑。这不是多装了 5 个工具——是把"自我进化"从口号变成了跑起来的管线。


HexaMind 系列文章: - 五层记忆体系 - 六层记忆架构进化 - 搭建攻略 - 完整实践 - 运维篇 - HexaMind v2.0