TMAP 平台针对图生视频模型在工业落地中面临的显存占用高、推理延迟大及成本昂贵等瓶颈,通过与“淘宝法象”团队合作,在多卡并行、Attention 加速、量化加速及缓存加速等领域进行了深入实践与优化。具体而言,平台采用 Deepspeed Ulysses 序列并行并结合通信重叠优化以降低单条请求延迟;引入 SageAttention 算子并设计层间选择性量化方案,在保持视频质量无损的前提下显著降低 Attention 耗时;通过线性层 W8A8/W8A16 混合量化解决显存溢出问题并消除 CPU Offload 开销;同时自研基于动态规划与路径感知成本张量的 DPCache 缓存方案,实现了比 TeaCache 和 TaylorSeer 更优的全局最优调度与加速效果。最终,该实践在生成质量肉眼不可区分的前提下,实现了除多卡外4.87倍的推理加速,将单次推理成本压缩至低于0.15元/秒。
AI图像生成模型的进步有目共睹——画面越来越精致,风格越来越多元。但当需求从"生成一张好看的图"转向"完成一项实际工作"时,局限随之显现:模型能生成一张惊艳的写实人像,却难以渲染一份排版精确的数学试卷、一页公式复杂的学术论文,或是去修复破损的古画。 一张图,能不能从"好看"真正走向"好用"?现在,给出我们的答案。 我们正式推出 Qwen-Image-3.0,Qwen-Image 系列的第三代图像生成基础模型。如果说 Qwen-Image-1.0 的关键词是 "准",Qwen-Image-2.0 的关键词是 "准 多 齐 美 真",那么 Qwen-Image-3.0 的核心主线只有一个字——"实"。
本文介绍了一个面向数据开发团队的数据需求交付 Agent Skill。该技能通过自然语言交互(可以是从 Aone、钉钉消息、PRD 中提取的描述),输出是一份结构化的 Copilot 交互物(prompt),可以直接复制到 DataWorks Copilot 或调用其他大模型中生成高质量 SQL 代码。让数据研发从“依赖人的连续投入的串行排期”转变为“Agent自动执行,人按优先级介入决策的并行推进”。文章从背景痛点、skill介绍、实战场景、核心能力拆解等方面系统展开,并在最后给出总结与展望,希望为同样在做数据质量保障和 Agent 工具落地的开发者提供参考。(文章内容基于作者个人技术实践与独立思考,旨在分享经验,仅代表个人观点。)
本文系统性地回顾了我们在构建企业级 AI Agent 平台过程中走过的完整技术演进路径——从大模型的先天约束出发,经历 Prompt 工程、Context 工程、Harness 工程三个阶段,最终演化出一套五层架构的 Agent 操作系统。每一层的出现都是因为前一层遇到了天花板。(文章内容基于作者个人技术实践与独立思考,旨在分享经验,仅代表个人观点。)
支付宝商家中心(b.alipay.com)是支付宝官方的商家服务平台,面向蚂蚁生态内所有商家,聚合产品签约、账户资金管理、营销运营、账单对账等能力,为商家提供一站式综合服务,帮助其更高效地开展日常经营,我们团队负责该平台的 PC 端业务测试。
本文介绍了“高价率运营 AI 工作台”中基于“约定驱动 + AI 编排”架构的自动化评测优化实践。针对 LLM Agent 场景下传统测试失效、反馈周期长等痛点,文章详细阐述了将评测体系作为核心工程产物的设计方案:通过标准化目录结构固化规范,利用 Coding Agent 实现自然语言驱动的全流程自动化;构建包含真实业务数据驱动的评测集生成、14 个通用维度与专项指标结合的 Rubric 体系、以及采用二元评分机制的 LLM Judge 双引擎架构(auto-evaluation 与 pinchbench-eval)。同时,文章深入剖析了金标设计中的信息隔离、粒度匹配等关键陷阱,并探讨了从半自动向全自动演进过程中,在评测入口、指标自动迭代及记忆机制等方面面临的技术挑战与应对策略,最终实现了将 Skill 可用性从主观判断转化为可量化、可复跑的工程闭环。
过去一个月,我们在搭建一个面向本地生活业务的分析类 Skill,让 AI 能像资深分析师一样做经营诊断、归因拆解和趋势预测。业务覆盖几十个行业,每个行业有独立的经营框架和指标体系,复杂度远超一个 prompt 能承载的范围。搭建过程中,我们经历了三次架构重构(V1 → V2 → V3),每次都是被真实问题逼出来的。这篇文章完整复盘了这个演进过程,最终提炼为六条 Skill 架构设计原则。如果你正在搭建领域知识密集型 Skill,或正面临「prompt 越写越长但效果越来越差」的困境,这篇文章或许能够提供一些思路。每章独立成节,可按需跳读。
淘宝闪购爆品团业务排序模型过去很长一段时间更像是在“堆模块”:遇到一个问题,就补一个结构。短期看,这种方式能持续拿收益,但当模型越做越大,结构碎片化、计算不够稠密、调参成本高等问题会越来越明显。这次爆品团排序模型升级,核心不是再增加一个局部模块,而是把主干从传统 DLRM 架构切到 Token-Based 的 RankMixer 架构。围绕这条主线,我们系统做了负采样、多任务学习、序列建模、Tokenization、FFN、MoE 和 Task Tower 等结构消融。多期迭代后,模型规模从 85M 扩展到 107M,再到 243M,并在爆品团频道页取得了稳定线上收益。