最近看到了一个挺有意思的东西,就是TypeSafe AI 做的 Jev。Reddit 上很多人用它玩 DOOM,也有人拿它玩 Mario。我申请之后,拿到 API Key 后,也做了一个网页小游戏,想看看它到底在里面起什么作用。一开始,我最想弄清楚的其实很简单:同样是让 AI 操作游戏,为什么要用 Jev?GPT 不能做吗?当然能。做完这个 demo,再看了一圈资料,我觉得可能值得讨论的是另一个问题:我们现在搭 Agent,经常让一个通用大模型反复决定下一步。这里面有多少事情,真的需要大模型完整的生成和推理能力?
消耗一个 Token,意味着你购买的不是存储空间、计算次数或信息传输,而是模型对你的问题进行一次智力加工的服务。理解一句话、生成一段代码、做出一个判断,这些过去只有人类大脑才能完成的智力活动,现在第一次拥有了可精确计量的单位和可执行的价格。经济学家有一种识别产业革命的朴素方法:看计量单位。我们回顾历次重大的经济变革,会发现一个不起眼但至关重要的变化反复出现——一种新的计量单位的诞生。计量单位定义了什么东西可以被交易、被定价、被纳入经济体系。一旦某种模糊的产出被标准化度量,围绕它的定价、交易、竞争和制度就会自然浮现。
一匹马能跑多快是天生的,但这份马力能不能用在该用的方向上、该收的时候收住,靠的是那副马具。harness 本义就是马具——套在马身上、把马力传导到车上的那整套装备。放到 Agent 上,它指的是模型之外那一层代码:这一轮让模型看到什么、它提出的操作准不准执行、失败怎么回喂、任务断了怎么接上、最后凭什么说事情做完了。 全文按「一个循环 → 四个子系统 → 生产化 → 长时运行 → 评测 → 选型」展开。读完你大概能看出市面上多数 Agent 产品里,哪些部分是模型给的,哪些部分是有人一行行写出来的。
音乐产业刚刚跨过一道门槛:创作一首歌的成本大幅降低。丰饶随之而来,被听见则成为新的稀缺。门槛降低之后暴露出来的,是另一套尚未成型的规则。
多 Agent 工作流里,真正拉高 Token 消耗的往往不是代码本身,而是长上下文在多轮请求中被反复携带。本文结合轻量云的一次真实研发实践,拆解如何通过渐进式加载、响应级批量和批量编辑工具减少不必要的模型往返。
本文件中的每一条规则都是强制性的。违反任何一条规则都会遭受毁灭性打击。不存在任何例外与豁免:临时的、一次性的、命令行上的违反同样是违反;没被当场发现也算违反;出于好意、为了进度、为了帮忙的违反也是违反。
遇到一次失败,就补一条要求;担心遗漏,再加一轮自检;让 LLM 优化,又得到一份更长的说明。提示词常常这样越写越长,但新增的文字,究竟解决了什么问题? 指令并非越长越好,也并非越短越好。 必要条件要补齐,重复与冲突要清理,专用资料要在需要时可达。现有研究没有给出通用的最佳字数,但能帮助我们判断这三类改动是否值得。 本文主要面向编写系统指令、Skill 和工作流的同学,重点讨论带工具、多步骤执行的 Agent。下面先给出修改方法,再解释研究依据;研究结果的适用范围以各自任务与实验设置为准。