本文介绍了淘宝主播Agent的Harness工程实战,旨在通过构建模型外层的工程化“骨架”解决大模型在高风险、高并发直播场景中不可控、易漂移的问题。文章首先定义了由执行循环、工具注册、上下文管理、状态存储、生命周期钩子和评估接口组成的Harness六元组,并确立了框架层兜底安全与状态、业务层专注技能开发的分层架构,采用MySQL、Hologres和GitLab分别存储会话、记忆和技能以实现逻辑统一与物理分治。在具体实践中,通过分层压缩与Reducer模式优化上下文,利用Schema强约束、幂等设计及五层纵深防御体系保障工具调用安全,引入沙箱隔离执行风险,并以DAG全局规划替代ReAct单步决策以提升长程任务的恢复性与效率。此外,文章详细阐述了基于会话、事实、行为三层结构的记忆体系,通过记忆对账机制与信任度演化算法,实现了Agent对主播偏好的精准理解与自适应输出,最终将不确定的模型能力转化为可用、可控、可演化的工业级产品。
(和 LLM 相关的)Memory 是一个被广泛关注和讨论的话题,其中,参数化 Memory 是 Memory 的一个重要分支。但是在众多的谈论中,我发现很多文章对于“参数化 Memory”这个概念的理解并不一致,比如认为“只要训练了一个记忆特化的模型,就归类为参数化 Memory 研究”。甚至在写下这篇文章之前,我也很难系统性地理解参数化记忆的本质是什么、难点如何,以及它和 LLM 的关系如何。因此,本文主要是梳理一些脉络,尝试从头理解参数化,以及理解记忆。故称为:“漫谈”(偏教学向、学习向)。
该文介绍了复杂业务场景下AI研发交付的实践方案,团队将流程分为三阶段,重点打造第一阶段底座。通过分层知识库设计(main全局业务、applications应用知识、candidate候选知识、personal个人经验、template模板),确保AI获取准确上下文;采用文件化的RD流程,用Markdown承载需求分析、拆解、实现校验全过程,使研发状态可接续、可review;前置质量门禁,在PRD验证、需求澄清、方案设计等关键节点设置人机协同review点,避免后期高成本返工。不追求100%全AI交付,强调AI负责分析实现、人聚焦关键判断,通过知识沉淀与流程规范提升整体交付质量与稳定性,为后续自动化和多Agent协同奠定基础。
本文介绍了百亿补贴 C 端 AI Coding 实战中端到端 CodingAgent 的设计与实践,旨在解决前端开发中重复编码、上下文理解成本高及视觉还原难等痛点。该 Agent 采用基于规范驱动与知识增强的自反思架构,通过构建包含页面、模块、组件等多层级的垂直领域知识库,并结合 Git Hooks 实现知识库的自动化同步与在线进化,确保代码生成的业务准确性与时效性。其核心能力涵盖多粒度输入适配、仓库智能匹配、设计稿到代码的智能转换(D2C)、业务代码生成及多层次质量验证,最终实现从需求描述到可交付工程代码的端到端自动化闭环,并已在依赖升级、页面开发等实际场景中落地提效。
本文分享了作者利用AI助手高效治理积压AB实验的实战经验,通过七步指令将原本繁琐的手动下线工作转化为自动化流程。核心方法是将复杂任务拆解为创建查询、扫描报告及版本升级等专用Skill工具,利用API批量获取实验状态并生成Markdown报告,随后以最小风险策略(将Key置空)批量固化代码,最终自动生成提测报告。文章强调了“工具化关键步骤”、“明确指令”及“人工Review”的重要性,并总结了API适配、JSON解析及版本冲突等踩坑教训,指出AI并非替代程序员,而是作为超级助手增强研发效能,帮助开发者从重复劳动中解放精力。
最近观察到一个现象:多数同学做 AI Coding 研发提效的第一反应,是把现有的研发流程 workflow 化,让 AI 在每个节点上提效。这条路有现实价值,但我认为它不是 AI Coding 的最终形态。写这篇文章的目的是表达我对 AI Coding 的理解与判断,欢迎拍砖。
本文讨论一种面向监控指标的自适应异常发现方法:系统从多天历史数据中学习正常形态,在保留固定阈值、前序环比、昨日同比等线上订阅规则兜底的同时,无需等待用户逐条订阅,即可生成带证据的异常候选。文中案例均已采用通用名称,日期及业务标识已隐去,量级与回放结果以相对化或区间化方式展示。图表用于说明数据形态与判断逻辑,不代表具体业务规模。
核心目标:用因果推断与博弈论方法,量化「因」对「果」的贡献度,精准定位复杂 AI 系统(LLM、Runtime Env、Tools等)的优化瓶颈。阅读导航:1.如果你已熟悉因果推断与归因分析的基础理论,可直接跳到 第 5 章:AI 评测中的归因分析实战;2.如果你关注方法选型,推荐先看 第 4.3 节:方法选择决策框架;3.如果你只想了解结论和实践经验,可直接看 第 6 章:总结与展望。