本月,美团LongCat 2.0 已正式开源,总参数 1.6T,平均激活约 48B,动态范围 33B 到 56B,原生支持 1M 超长上下文。这是首个在五万张国产算力卡上完成全流程训练与推理的万亿参数模型。开源只是第一步,让 LongCat 2.0 在真实的工作任务中成为可靠的“工作伙伴”,才是真正的考验。现在,搭载 LongCat 2.0 的美团全场景 AI Agent 平台 CatPaw 正式上线,将模型能力从“跑得动”推向“用得好”。CatPaw 提供开箱即用的 AI 智能工作台与企业级 Agent 开发托管能力。不仅如此,依托美团十余年深耕本地生活的行业积累,CatPaw 将商家经营、服务履约与消费决策的深度认知融入其中,助力企业构建 AI 数字员工、推进业务智能化升级。目前,CatPaw 已在美团内部大规模落地:累计覆盖 9 万员工、搭建 Agent 3 万个,并在多个真实业务场景中完成验证。
本文针对服务端AI Coding在复杂业务场景中难以达到生产级质量的问题,提出并实践了基于SDD(规格驱动开发)的解决方案。通过摒弃完全自动化的端到端流程,转而采用“开发者深度参与”结合Aone Copilot工具链的模式,将Spec作为唯一真相源以解决AI的概率性输出、上下文限制及局部视野瓶颈;同时引入自进化记忆机制(topic-open/save)管理跨会话上下文,确保知识沉淀与风格一致。最终在百亿补贴项目中实现了0手写代码的高质量交付,证明了SDD方法论配合开发者对Spec定义、架构审核及质量把控的深度介入,是将AI Coding从实验性工具转化为可控、可复制的生产力关键。
当 Agent 自己会出题、自己会答题、还能把答错的经验沉淀成下一次的"技能包"——一个永远在长大的 Agent,到底能走多远?十几篇论文反复啃读,从"存技能"到"训技能",再到"零数据自训",我们终于摸清了自进化 Agent 这条赛道的脉络。本文将带你深入 Agent 的"经验大脑"——从把经验写进文件,到把经验训进权重,再到完全无人工数据的自我循环,一步步拆解研究路径。
在 《是时候了解一下 Git worktree 了》 一文中,我们介绍了如何在 Codex、Claude Code 等 Coding Agent 中利用 Git worktree 实现并行开发。不过,那篇文章聚焦于单仓库场景。当我们尝试将 worktree 应用于采用多仓库架构的 LLM Arena 平台时,又遇到了一系列新问题。 本文记录我们如何为多仓库场景设计面向 Coding Agent 的 worktree 工作流,以及如何处理子模块初始化、需求编号冲突和多 Agent 编排等问题。
本文是得物技术专家在 AICon 上海演讲整理的技术实录。AICon上海2026_全球人工智能开发与应用大会暨大模型应用生态展_InfoQ技术大会 「得物推荐 AI Harness 工程化实践系列」的末篇内容,本系列共三篇连载。本篇(末篇)详解得物推荐评测平台的完整技术体系:从主观体验量化到大模型自动化评测流水线,涵盖多维度指标设计、人机协作提示词校验闭环、分布式任务调度与成本精控等核心工程实现,以及单周百万级审计需求下实现 91% 资源成本优化的工业级落地实战细节。