本文介绍了淘宝主播Agent的Harness工程实战,旨在通过构建模型外层的工程化“骨架”解决大模型在高风险、高并发直播场景中不可控、易漂移的问题。文章首先定义了由执行循环、工具注册、上下文管理、状态存储、生命周期钩子和评估接口组成的Harness六元组,并确立了框架层兜底安全与状态、业务层专注技能开发的分层架构,采用MySQL、Hologres和GitLab分别存储会话、记忆和技能以实现逻辑统一与物理分治。在具体实践中,通过分层压缩与Reducer模式优化上下文,利用Schema强约束、幂等设计及五层纵深防御体系保障工具调用安全,引入沙箱隔离执行风险,并以DAG全局规划替代ReAct单步决策以提升长程任务的恢复性与效率。此外,文章详细阐述了基于会话、事实、行为三层结构的记忆体系,通过记忆对账机制与信任度演化算法,实现了Agent对主播偏好的精准理解与自适应输出,最终将不确定的模型能力转化为可用、可控、可演化的工业级产品。
在 AI 很强的现在,依然很多人会认为,AI 更适用于新项目快速迭代,但很难在一个背负着沉重的历史包袱的项目中起到很大的用处。最近大半年都在重构项目,从前期使用 AI 依然困难重重,到如今 AI 能高效定位问题、给到十分贴合项目需要的解决方案,中间特别明显的一个转折点,在于开始给项目搭建 AI 上下文工程。当然,这一年来 AI 的能力本身也在不断加强,我们项目的质量和架构的合理性在我的努力重构下也在稳步提升,但 AI 上下文的搭建依然起到了十分关键的作用。今天给大家分享的,主要是如何在重构过程中,将 AI 总是胡言乱语,变成了 AI 也可高效助力的一个项目。
(和 LLM 相关的)Memory 是一个被广泛关注和讨论的话题,其中,参数化 Memory 是 Memory 的一个重要分支。但是在众多的谈论中,我发现很多文章对于“参数化 Memory”这个概念的理解并不一致,比如认为“只要训练了一个记忆特化的模型,就归类为参数化 Memory 研究”。甚至在写下这篇文章之前,我也很难系统性地理解参数化记忆的本质是什么、难点如何,以及它和 LLM 的关系如何。因此,本文主要是梳理一些脉络,尝试从头理解参数化,以及理解记忆。故称为:“漫谈”(偏教学向、学习向)。
不知道你有没有过这样的体验:在地铁里刷着社交软件,突然进了一个信号盲区,屏幕瞬间变成一片刺眼的空白,只剩下一个“网络连接失败”的加载圈在无情旋转。这种时候,用户往往会烦躁地直接滑掉 App。为了给用户提供无缝的体验,离线缓存(Offline Caching) 是移动端开发无法绕过的一环。但是,App 里的数据五花八门:有几 KB 的“夜间模式”开关状态,有几万条结构化的聊天记录,还有几十 MB 的视频文件……在 Android 开发中,数据也是分“轻重缓急”和“体量大小”的。 你总不能把一个 50MB 的离线视频,塞到跟“夜间模式开关”一样的地方去存储吧?现代 Android 开发为我们提供了 4 种主流的本地存储方式。今天,我们就用大白话和生活中的生动比喻,带你彻底理清它们各自的特点、适用场景,以及在 Kotlin 中如何优雅地实现它们。
本篇博客是一篇科普文章,由浅入深的介绍Agent评测。其中前两章系统介绍了评测是什么,以及如何建立评测体系;其中第二章是美团图灵Agent评测团队深入美团各业务团队BP总结出的实践经验,是我们在两年实践过程中逐步打磨出来的认知。第三章重点介绍了龙虾/爱马仕这类长程Agent框架的出现对评测带来的变化。本篇博客在美团内部发表之后获得了较多的关注,我们发现大家对Agent评测的热情非常高,因此我们决定将内部博客进行公开,想把这些经验分享给更多的同学,希望对大家有所启发或帮助。