本文介绍了一套覆盖小游戏从选型、生产到上线迭代全链路的自迭代 Agent 系统。针对单点 AI 提效无法带动整体业务提速的痛点,该系统将分散的 AI 能力串联,由人定义北极星指标与行动边界并审核关键方案,AI 负责策略、开发与数据归因。架构上分为数据感知、运营 Agent、生产 Agent 及游戏基础工程等层级,通过 LangGraph 与 Claude Agent SDK 协同,实现多 Agent 上下文流转与决策闭环。实践表明,该系统两周内可上线 6 款小游戏,最快 2 天完成全流程;运营侧 12 款游戏迭代的正向率超 95%。未来计划将其扩展至更广义的互动玩法,打造可持续探索与优化的互动服务。
本文探讨了“Loop engineering”这一理念,即工程师不再逐轮提示agent,而是设计包含读取状态、判断任务、执行操作、验证结果、记录状态和判断停止条件的自动化循环系统。文章详细拆解了支撑该系统的六大组件:负责唤醒的自动化机制、隔离并行的worktrees、沉淀项目知识的skills、接入外部工具的插件、分离读写职责的子agent以及确保状态持久化的记忆层。作者强调,loop engineering并非盲目追求全自动,而是通过明确输入输出、严格权限分层与成本控制来保障工程可靠性。工程师的角色从单轮操作者转变为循环机制的设计者与最终责任人,其核心价值在于利用可控的自动化杠杆加深对系统的理解,而非单纯甩锅给AI以逃避责任。
策略效果类Agent评测面临反馈信号稀缺、评估多维权衡、离线与线上效果脱节三大难题。文章提出"五层、四步、三阶段"方法论:五层评测对象(从Prompt约束到业务效果)明确"评什么";四步质量归因(诊断、定位、优化、验证)解决"评完怎么办";三阶段上线治理(准入、灰度、监控)回答"如何上线"。针对离线评测与线上效果对齐难题,创新性提出Auto Rubrics方法,通过三层架构构建可解释的业务效果Judge体系,有效规避位置偏差、选择过拟合等系统性陷阱,实现策略效果的可信评估,为策略类Agent规模化落地提供质量保障。该方法论将评测从静态判断转变为动态闭环,确保策略生成能力真正可扩、可控、可回归。
本文基于GEPA(Genetic-Pareto,Reflective Prompt Evolution)[1]算法,设计并实现了一套Prompt 自进化系统,解决当前Prompt优化依赖人工经验导致的盲目性高、难以复制、缺乏权衡机制等痛点。该系统构建"推理→评分→反思→选择"的自动化闭环,通过数据驱动的反思式变异机制,让LLM自动分析Badcase、归因至Prompt具体规则、生成候选变体,并基于帕累托前沿进行多目标择优,避免单点优化引发的指标对抗性退化[1]。系统采用任务无关架构,支持二分类、多分类、评分等多种场景,通过零配置设计实现自动数据集分析与配置推断,同时提供可解释的优化过程。GEPA将Prompt优化从人工试错转变为有量化依据的自动化寻优,显著提升与人工标注及线上业务效果的对齐能力,为AI评估器提供可持续进化的技术底座。
AI 技术正在以前所未有的速度迭代,Agent、Loop-Engineering、Skills、Harness、LLM-Wiki、RAG、Memory等概念在短期内几乎同时涌入工程讨论,Demo 的构建门槛被持续压低——可视化编排加上 Vibe-Coding,一个过去需要数周才能搭起来的演示,如今往往几天或者在更短的时间内就能跑通。但进入企业生产环境之后,稳定性、可控性、可审计性和业务闭环能力,仍然是没有捷径的硬仗。我们从企业落地的视角,系统回答一个问题:在技术名词和概念永远追不完的时代,垂类业务如何抓住不变的本质,让 AI Agent 从「能跑」走向「能生产」?
近日,由莫斯科国立大学(Moscow State University,MSU)举办的第19届MSU世界视频编码器大赛(MSU 2025 FullHD赛道)结果正式揭晓。在这场汇聚了腾讯、快手、AOMedia及OpenVisualCloud等国内外顶尖团队、27款主流编码器同台竞技的权威评测中,淘天音视频技术团队自主研发的S266系列编码器表现出色,累计斩获6项世界冠军及1项季军。
HL-Mem 是一套旨在让 Agent 像人一样具备长期记忆能力的本地化记忆系统,其核心设计理念是将记忆视为受治理的认知系统而非简单的数据存储。该系统借鉴认知科学原理,采用事实与经验双通道架构,通过保留不可变的原始事件(Event)和可更新的结构化事实(Claim),实现了证据可追溯、时间可解释(区分有效时间与记录时间)以及记忆的动态修正与遗忘。在工程实现上,HL-Mem 坚持运行时独立和本地优先原则,默认仅依赖 SQLite 单文件部署,通过后台异步 Worker 处理去重、冲突消解和生命周期管理,有效平衡了记忆治理的完整性与部署复杂度,为个人 Agent 提供了低成本、高可控且支持中文环境的长期记忆基础设施。