最近看到了一个挺有意思的东西,就是TypeSafe AI 做的 Jev。Reddit 上很多人用它玩 DOOM,也有人拿它玩 Mario。我申请之后,拿到 API Key 后,也做了一个网页小游戏,想看看它到底在里面起什么作用。一开始,我最想弄清楚的其实很简单:同样是让 AI 操作游戏,为什么要用 Jev?GPT 不能做吗?当然能。做完这个 demo,再看了一圈资料,我觉得可能值得讨论的是另一个问题:我们现在搭 Agent,经常让一个通用大模型反复决定下一步。这里面有多少事情,真的需要大模型完整的生成和推理能力?
本文探讨了“Loop engineering”这一理念,即工程师不再逐轮提示agent,而是设计包含读取状态、判断任务、执行操作、验证结果、记录状态和判断停止条件的自动化循环系统。文章详细拆解了支撑该系统的六大组件:负责唤醒的自动化机制、隔离并行的worktrees、沉淀项目知识的skills、接入外部工具的插件、分离读写职责的子agent以及确保状态持久化的记忆层。作者强调,loop engineering并非盲目追求全自动,而是通过明确输入输出、严格权限分层与成本控制来保障工程可靠性。工程师的角色从单轮操作者转变为循环机制的设计者与最终责任人,其核心价值在于利用可控的自动化杠杆加深对系统的理解,而非单纯甩锅给AI以逃避责任。
消耗一个 Token,意味着你购买的不是存储空间、计算次数或信息传输,而是模型对你的问题进行一次智力加工的服务。理解一句话、生成一段代码、做出一个判断,这些过去只有人类大脑才能完成的智力活动,现在第一次拥有了可精确计量的单位和可执行的价格。经济学家有一种识别产业革命的朴素方法:看计量单位。我们回顾历次重大的经济变革,会发现一个不起眼但至关重要的变化反复出现——一种新的计量单位的诞生。计量单位定义了什么东西可以被交易、被定价、被纳入经济体系。一旦某种模糊的产出被标准化度量,围绕它的定价、交易、竞争和制度就会自然浮现。
一匹马能跑多快是天生的,但这份马力能不能用在该用的方向上、该收的时候收住,靠的是那副马具。harness 本义就是马具——套在马身上、把马力传导到车上的那整套装备。放到 Agent 上,它指的是模型之外那一层代码:这一轮让模型看到什么、它提出的操作准不准执行、失败怎么回喂、任务断了怎么接上、最后凭什么说事情做完了。 全文按「一个循环 → 四个子系统 → 生产化 → 长时运行 → 评测 → 选型」展开。读完你大概能看出市面上多数 Agent 产品里,哪些部分是模型给的,哪些部分是有人一行行写出来的。
策略效果类Agent评测面临反馈信号稀缺、评估多维权衡、离线与线上效果脱节三大难题。文章提出"五层、四步、三阶段"方法论:五层评测对象(从Prompt约束到业务效果)明确"评什么";四步质量归因(诊断、定位、优化、验证)解决"评完怎么办";三阶段上线治理(准入、灰度、监控)回答"如何上线"。针对离线评测与线上效果对齐难题,创新性提出Auto Rubrics方法,通过三层架构构建可解释的业务效果Judge体系,有效规避位置偏差、选择过拟合等系统性陷阱,实现策略效果的可信评估,为策略类Agent规模化落地提供质量保障。该方法论将评测从静态判断转变为动态闭环,确保策略生成能力真正可扩、可控、可回归。
最近手里一个项目要用消息队列,正好赶上它接入 AI 这件事,然后我把 RocketMQ 重新捡起来研究了一下。五月底发布的 RocketMQ 5.5.0,把专门为 AI 场景设计的 LiteTopic 消息模型放进了开源版本,也就是社区提案 RIP-83 里定义的那套东西。我之前用 RocketMQ,跑的都是订单、日志这一类传统场景,这次看到官方针对 AI 负载专门做了消息模型,还顺手把 MCP、A2A 这些智能体协议的支持也做了,就花时间把官方文档和代码都翻了一遍。先说清楚一个容易误会的地方,RocketMQ 接入 AI,它自己并没有变成大模型,干的还是消息队列的老本行。变化主要在这套新的主题模型上,它是照着 AI 应用的通信特点做出来的。另外 LangChain、CrewAI、AutoGen、Dify 这些主流 Agent 框架也都能对接。这篇文章就说两件事:它是怎么接入 AI 的,以及对比以前的 RocketMQ,到底多解决了哪些问题。