一辆车从地面驶入隧道,网络从 5G 掉到 4G,再掉到无信号,出隧道又切回 5G。整个过程 40 秒。在车端日志里,这 40 秒是这样的:TCP 连接在信号衰减时卡在重传与内核超时退避里;等系统终于宣布连接死亡,车端 SDK 才开始重连——TCP 三次握手加 TLS 握手,在刚恢复的弱信号下又是若干次往返。加起来,这辆车有 8 秒 左右处于「物理上有网、业务上失联」的状态。更麻烦的在服务端:早高峰时段,几千辆车先后穿过同一段隧道,然后几乎同时向 Broker 发起重连。每次重连都要完整握手、鉴权、恢复订阅关系、清理旧连接状态。
本文讲述腾讯15年资深后台工程师,在 AI 时代如何入门大模型推理工程。全文围绕三条主线展开:从资深后台工程师到推理工程新人的抉择、推理工程的入门路径与自检方法、AI Infra 与通用 Infra 的同源与分野。
SRE 每天面对去重后数百个错误码告警:retcode 含义不清、调用链难追、运行时证据分散。人工排查一个错误码需要 3~8 小时不等,大量时间花在跨系统检索和上下文拼凑上,推给开发后往往还要再查一遍。我们基于智能体编排平台搭建了错误码治理 Agent:将知识库、代码关系图谱、可观测平台数据和代码托管平台四类能力挂载到同一个 Agent,由它自主编排排查流程,分钟级产出根因分析和修复建议。在 50 条 case 对比中,优化后的 action_type 与人工标注一致率从 66% 提升到 88%,硬冲突率从 20% 降至 0%。这篇文章重点分享三个实践:如何组织多源证据、如何让长链路排查稳定产出,以及如何用案例和回归评测持续迭代 Skill。
最近看到了一个挺有意思的东西,就是TypeSafe AI 做的 Jev。Reddit 上很多人用它玩 DOOM,也有人拿它玩 Mario。我申请之后,拿到 API Key 后,也做了一个网页小游戏,想看看它到底在里面起什么作用。一开始,我最想弄清楚的其实很简单:同样是让 AI 操作游戏,为什么要用 Jev?GPT 不能做吗?当然能。做完这个 demo,再看了一圈资料,我觉得可能值得讨论的是另一个问题:我们现在搭 Agent,经常让一个通用大模型反复决定下一步。这里面有多少事情,真的需要大模型完整的生成和推理能力?
消耗一个 Token,意味着你购买的不是存储空间、计算次数或信息传输,而是模型对你的问题进行一次智力加工的服务。理解一句话、生成一段代码、做出一个判断,这些过去只有人类大脑才能完成的智力活动,现在第一次拥有了可精确计量的单位和可执行的价格。经济学家有一种识别产业革命的朴素方法:看计量单位。我们回顾历次重大的经济变革,会发现一个不起眼但至关重要的变化反复出现——一种新的计量单位的诞生。计量单位定义了什么东西可以被交易、被定价、被纳入经济体系。一旦某种模糊的产出被标准化度量,围绕它的定价、交易、竞争和制度就会自然浮现。
一匹马能跑多快是天生的,但这份马力能不能用在该用的方向上、该收的时候收住,靠的是那副马具。harness 本义就是马具——套在马身上、把马力传导到车上的那整套装备。放到 Agent 上,它指的是模型之外那一层代码:这一轮让模型看到什么、它提出的操作准不准执行、失败怎么回喂、任务断了怎么接上、最后凭什么说事情做完了。 全文按「一个循环 → 四个子系统 → 生产化 → 长时运行 → 评测 → 选型」展开。读完你大概能看出市面上多数 Agent 产品里,哪些部分是模型给的,哪些部分是有人一行行写出来的。
音乐产业刚刚跨过一道门槛:创作一首歌的成本大幅降低。丰饶随之而来,被听见则成为新的稀缺。门槛降低之后暴露出来的,是另一套尚未成型的规则。
多 Agent 工作流里,真正拉高 Token 消耗的往往不是代码本身,而是长上下文在多轮请求中被反复携带。本文结合轻量云的一次真实研发实践,拆解如何通过渐进式加载、响应级批量和批量编辑工具减少不必要的模型往返。