本文是得物技术专家在 AICon 上海演讲整理的技术实录。AICon上海2026_全球人工智能开发与应用大会暨大模型应用生态展_InfoQ技术大会 「得物推荐 AI Harness 工程化实践系列」的末篇内容,本系列共三篇连载。本篇(末篇)详解得物推荐评测平台的完整技术体系:从主观体验量化到大模型自动化评测流水线,涵盖多维度指标设计、人机协作提示词校验闭环、分布式任务调度与成本精控等核心工程实现,以及单周百万级审计需求下实现 91% 资源成本优化的工业级落地实战细节。
CVPR 2026 Highlight 丨 用“几何感知”把扩散 Transformer 采样做成免训练加速器
我们用 AI Agent 驱动前后端全流程开发——从需求分析到自动化测试,整个 harness 工作流由 1 个 TL + 6 个子 Agent 组成。跑起来之后第一个问题就是:钱烧得很快,但完全不知道烧在哪。我们先用 AgentLens 把成本拆开看,发现系统提示词、工具返回信息、历史消息是大头。围绕"让 AI 只看到当前需要的上下文、减少无关的上下文、减少重复的上下文"这三个原则,我们逐一改造了架构拆分、稳定前缀、渐进式披露、代码图谱、CLI 替代 MCP、长期记忆按需索引、工具调用并行化等 10 个方向。整体全流程预估降本 50%~65%。
在上一篇讨论《后端系统 AI Friendly 设计》时,文章开篇就强调过一个判断:后端系统要想真正进入 AI Friendly 状态,不能只停留在“代码写得清楚一点”、“README 多补一点”、“接口注释完整一点”这种层面。这些当然重要,但它们解决的更多是“人和 AI 能不能读懂局部代码”的问题,而不是“AI 能不能在一个复杂系统里做出正确的工程判断”。
TMAP 平台针对图生视频模型在工业落地中面临的显存占用高、推理延迟大及成本昂贵等瓶颈,通过与“淘宝法象”团队合作,在多卡并行、Attention 加速、量化加速及缓存加速等领域进行了深入实践与优化。具体而言,平台采用 Deepspeed Ulysses 序列并行并结合通信重叠优化以降低单条请求延迟;引入 SageAttention 算子并设计层间选择性量化方案,在保持视频质量无损的前提下显著降低 Attention 耗时;通过线性层 W8A8/W8A16 混合量化解决显存溢出问题并消除 CPU Offload 开销;同时自研基于动态规划与路径感知成本张量的 DPCache 缓存方案,实现了比 TeaCache 和 TaylorSeer 更优的全局最优调度与加速效果。最终,该实践在生成质量肉眼不可区分的前提下,实现了除多卡外4.87倍的推理加速,将单次推理成本压缩至低于0.15元/秒。