TMAP 平台针对图生视频模型在工业落地中面临的显存占用高、推理延迟大及成本昂贵等瓶颈,通过与“淘宝法象”团队合作,在多卡并行、Attention 加速、量化加速及缓存加速等领域进行了深入实践与优化。具体而言,平台采用 Deepspeed Ulysses 序列并行并结合通信重叠优化以降低单条请求延迟;引入 SageAttention 算子并设计层间选择性量化方案,在保持视频质量无损的前提下显著降低 Attention 耗时;通过线性层 W8A8/W8A16 混合量化解决显存溢出问题并消除 CPU Offload 开销;同时自研基于动态规划与路径感知成本张量的 DPCache 缓存方案,实现了比 TeaCache 和 TaylorSeer 更优的全局最优调度与加速效果。最终,该实践在生成质量肉眼不可区分的前提下,实现了除多卡外4.87倍的推理加速,将单次推理成本压缩至低于0.15元/秒。
AI图像生成模型的进步有目共睹——画面越来越精致,风格越来越多元。但当需求从"生成一张好看的图"转向"完成一项实际工作"时,局限随之显现:模型能生成一张惊艳的写实人像,却难以渲染一份排版精确的数学试卷、一页公式复杂的学术论文,或是去修复破损的古画。 一张图,能不能从"好看"真正走向"好用"?现在,给出我们的答案。 我们正式推出 Qwen-Image-3.0,Qwen-Image 系列的第三代图像生成基础模型。如果说 Qwen-Image-1.0 的关键词是 "准",Qwen-Image-2.0 的关键词是 "准 多 齐 美 真",那么 Qwen-Image-3.0 的核心主线只有一个字——"实"。
地图情报核实要判断"某段路到底有没有车走过"。车少的长尾路段(乡道、新修路、偏远低频路)要把时间拉到半年才攒得出足够轨迹,而这批 180 天、近 10 万亿点的历史轨迹躺在离线数仓里,查一次要跑几个小时。我们用一套建在 ClickHouse 上的检索服务,把它做成在线可查——任意区域检索 TTFB 0.35s。本文复盘我们如何用 ClickHouse + S2 地理编码 + 流式检索,在近 10 万亿轨迹点的底库上做到任意区域秒级可视化。既有存储引擎选型、地理索引设计的原理解析(第 5 节),也有一线踩出来的避坑经验(第 6 节)。适合关注海量数据检索、时空数据处理、OLAP 实战的同学。
从 ReAct 出发,文章讨论 Agent 工程如何从“模型循环”走向 Harness:通过前后端共享的 State Schema、运行事实和 UI 边界,让模型行为变成可交互、可恢复、可控制、可追溯的产品能力。