你的 Agent 上线半年了。回头看看——它比第一天聪明了吗?它可能还在犯三个月前就犯过的错。还在重复三个月前就走过的弯路。还在对三个月前就见过的场景表现得像个新手。半年的线上流量喂过去,它一点经验都没攒下来。问题不在模型不够强。问题在于——没有人给它搭一条从"做过"到"记住"到"变好"的路。这篇文章基于对 Anthropic 递归自改进报告、斯坦福 CS329A 课程、EvoAgentX 等开源框架的深度研读,结合业界多个团队已验证的优秀实践,提炼出一套评测→记忆→落地→控制的四齿飞轮方法论——不是某个环节的最佳实践,而是一个完整的、可落地的、经过验证的工程闭环。
个人提效不等于组织提效。一个人变成「超级兵」并不能提升团队的需求交付数据。本文讲清三件卡在中间的事,以及我们用 Workspace 这个「面向 Agent 的组织资产基座」怎么解。
在 MultiAgent 平台中,Agent 一次请求可能同时经过模型、MCP/A2A 工具、RAG、Workflow 和 Sandbox,还要在多轮对话和跨会话协作中记住用户偏好、任务进展与协作约定。因此记忆模块不是独立外挂,而是 Agent 执行链路的一部分。
历史服务重构,主要难点不在于翻译代码,而在于先把多年迭代后散落在调用链里的业务逻辑(如状态机分支、隐式校验、数据依赖等)梳理清楚,再据此做更合理的分层改造与业务适配。我们针对服务重构场景,沉淀成一个 Skill,用流程拆分、分层知识库和 Harness Engineering 三部分把重构流程标准化,并在十几个真实重构场景中验证其价值。
本文指出随着AI模型在代码生成基准测试中取得高分,Coding环节已趋近被解决,但研发整体效率并未同步提升,瓶颈已转移至编码之外的环境与验证环节。作者通过类比电气化革命中从“电力轴传动”到“单元驱动”的转变,批判了当前将AI简单嵌入原有固定工作流(Spec驱动)的做法,认为这限制了AI的自主性且收益线性递减。文章主张转向“环境与验证驱动”,即停止在提示词编排等易被模型迭代抵消的领域过度投入,转而致力于将企业内部构建、部署、测试、监控等研发系统改造为AI可调用的工具和环境,使AI能自主获取反馈并独立运转。这种围绕自有环境资产的投入能与模型能力形成乘法效应,从而持续放大AI带来的生产力红利。
本文以百亿补贴详情助手 Skill 的迭代历程为例,总结 Skill 研发与迭代实践。文章先梳理业界方法论——Claude Skills 的渐进式披露与控制调优、MiniMax 的工业化规范、以及常见的 Skill 设计模式;随后从架构设计、研发效能、运行优化 3 个维度展开详细介绍了桥接器解耦本地 Skill 与远程 Agent、按需共享上下文、优先输出优质 HTML 报告等高效实践,帮助读者提高 Skill 研发效能。