本文将拆解大模型中几个核心操作(RMSNorm、Softmax、Causal Mask、Sampling)背后的数学与 Infra 优化逻辑。看完你会发现,Infra 优化,本质上就是在用数学上的等价变换,或者对精度的适度妥协,去换取更高的硬件利用率和极致的推理速度。PS: 当然最核心的操作肯定是矩阵乘法,这个放到下一篇吧 《AI Infra入门:从矩阵乘法到FlashAttentionV4》~其他的还有RoPE和残差连接没有提及~
当 AI Agent 从"Demo 可用"走向"生产可靠",测评就是那道必须跨过的门槛。本文介绍了 TEG云架构平台部 网关测试团队 在 AI Agent 测评领域的体系化实践,面对 Agent 非确定性、黑盒化、错误级联放大三大难题,建立了一套"确定性评分器 + Rubric 评分器 + 人工评分器"三类组合的完整测评框架,覆盖功能正确性、过程质量、效率成本、鲁棒性安全、体验对齐五大维度,并已在 TPerf 性能平台智能分析 Agent 项目中落地验证。无论你是刚开始构建 Agent 测评体系,还是已有初步实践希望系统化升级,都可以从中找到可直接复用的方法论、评分模板与工程实现方案。
适用:CodeBuddy、Cursor、Codex、Gemini CLI 等这类 AI Coding Agent。读完你会得到三样东西:一个正确的心智模型、一份今天就能做的行动清单、几套继续往下压成本的工程方法。
HPC-Ops 是腾讯混元 AI Infra 团队开源并长期维护的一套工业级、高性能的大模型推理底层算子库。在首轮开源中,HPC-Ops 提供了 Attention、GroupGEMM 等在内多个高性能算子,原生支持 BF16 与多种 FP8 量化方案,针对常见的主流推理硬件进行了深度优化。近日,为了进一步满足推理系统对动态业务负载的适应性、核心模块对复杂精度和高性能融合算子的需求,HPC-Ops 推出全新更新升级,包含五大关键算子。本次升级在主流推理平台上,有效缓解了Attention长尾延迟、显存搬运开销、跨卡通信等实际工程瓶颈,多项性能指标显著优于现有的开源基线。
软件开发进入 AI 时代以后,自动生成、自动补全、自动重构成了一种新潮。年轻程序员们开始学习如何拆分任务,审查 AI 输出,管理上下文,多 Agent 并行;面试也从古法编程的刷题,变成了“如何让 AI 稳定生成可维护代码?” 于是有老师傅哀叹,设计模式已死。可新人们却无动于衷,因为他们现在关心的是 Harness。可真当你去深入研究多 Agent 系统时,你会发现,AI 自发地演化出了一套类似设计模式的结构,就连 Harness 本身也跟设计模式有莫大的关联性。 当AI系统拥有足够复杂的任务和自治能力时,它最终会收敛到与人类工程设计相同的底层抽象,某些组织方式,会不可避免地再次出现。这或许对当下的 AI FOMO 焦虑有一种神奇的治愈作用,不管编程范式如何变化,经典始终是经典。 所以,咱们今天试着沉下心来,抛开 AI 的浮躁,重新去回顾一下,设计模式的经典吧!
Kuikly 是腾讯基于 Kotlin Multiplatform (KMP) 技术构建的全平台高性能开发框架,具有一码多端、极致易用、动态灵活特点,覆盖 Android、iOS、HarmonyOS、H5、微信小程序、Mac 六大平台。得益于 Kotlin/Native 编译产物与原生渲染管线,Kuikly 已具备原生级性能表现;为进一步压榨首屏体验,我们推出了加速方案 TurboDisplay,通过节点缓存、主线程端侧直出与双线程并行渲染,在二次打开场景下实现"秒开",并在 QQ 游戏、输入法、腾讯地图等线上业务中取得 60%~80% 以上的耗时优化。本文将深入解析其设计思路与核心机制。
2026 年的夏天,中文互联网圈出现了一个有趣的现象。日活(DAU)这把单一的尺子不那么好用了。当 AI 助手替用户去办事,Agent根本不需要打开我们的 App,而是通过API、MCP、A2A、CLI等方式调用能力。APP打开次数变少了,是产品变差了,还是用户的事更高效地办成了?这把尺子已经分不清。在硅谷,a16z 的年度报告里直接写了一句话:屏幕时代终结。或许未来我们可以给日活换成了一个新概念:任务完成率 TCR(Task Completion Rate)。它衡量的不是用户打开你的产品几次,而是用户交给 Agent 的一件事,到底有没有被完整地、可验证地办成。在不远的将来,整个互联网行业可能要换一把衡量的标尺。这背后,其实是商业模式的代际更替。智联网,这种以Agent为行为主体的新运行方式,正在悄然生长,有望成为移动互联网的升级版。