在电商搜索的演进历程中,“召回”始终是连接用户意图与海量商品的基石。长期以来,业界普遍采用“判别式检索”范式:无论是基于倒排索引的关键词匹配,还是基于ANN近邻检索的Embedding相似度计算,其核心逻辑都是在给定候选集中“寻找”最相似的结果。 然而,随着用户需求的日益多样化与口语化,传统范式在交易搜索场景中面临严峻挑战。基于关键词的倒排索引受限于“词汇鸿沟”,难以处理【“af1” vs “空军一号”,"yeezy" vs "椰子"】这类语义一致但字面不匹配的Query;而基于向量检索的判别模型,在长尾Query和冷启动商品场景下,往往因行为数据稀疏而表现乏力。此外,传统的“召回-粗排-精排”级联架构存在天然的信息漏斗,一旦高价值商品在召回阶段被遗漏,后续链路将无力回天。 过去一年,得物交易搜索团队核心目标是打破这一僵局。我们不再满足于让模型做“选择题”,而是尝试赋予模型“创造力”。我们将生成式建模(Generative Modeling)引入召回场景,探索从“检索”到“生成”的范式跃迁,并围绕大语言模型、多模态表征及序列建模展开了一系列算法研发。
最近看到了一个挺有意思的东西,就是TypeSafe AI 做的 Jev。Reddit 上很多人用它玩 DOOM,也有人拿它玩 Mario。我申请之后,拿到 API Key 后,也做了一个网页小游戏,想看看它到底在里面起什么作用。一开始,我最想弄清楚的其实很简单:同样是让 AI 操作游戏,为什么要用 Jev?GPT 不能做吗?当然能。做完这个 demo,再看了一圈资料,我觉得可能值得讨论的是另一个问题:我们现在搭 Agent,经常让一个通用大模型反复决定下一步。这里面有多少事情,真的需要大模型完整的生成和推理能力?
本文探讨了“Loop engineering”这一理念,即工程师不再逐轮提示agent,而是设计包含读取状态、判断任务、执行操作、验证结果、记录状态和判断停止条件的自动化循环系统。文章详细拆解了支撑该系统的六大组件:负责唤醒的自动化机制、隔离并行的worktrees、沉淀项目知识的skills、接入外部工具的插件、分离读写职责的子agent以及确保状态持久化的记忆层。作者强调,loop engineering并非盲目追求全自动,而是通过明确输入输出、严格权限分层与成本控制来保障工程可靠性。工程师的角色从单轮操作者转变为循环机制的设计者与最终责任人,其核心价值在于利用可控的自动化杠杆加深对系统的理解,而非单纯甩锅给AI以逃避责任。
消耗一个 Token,意味着你购买的不是存储空间、计算次数或信息传输,而是模型对你的问题进行一次智力加工的服务。理解一句话、生成一段代码、做出一个判断,这些过去只有人类大脑才能完成的智力活动,现在第一次拥有了可精确计量的单位和可执行的价格。经济学家有一种识别产业革命的朴素方法:看计量单位。我们回顾历次重大的经济变革,会发现一个不起眼但至关重要的变化反复出现——一种新的计量单位的诞生。计量单位定义了什么东西可以被交易、被定价、被纳入经济体系。一旦某种模糊的产出被标准化度量,围绕它的定价、交易、竞争和制度就会自然浮现。
一匹马能跑多快是天生的,但这份马力能不能用在该用的方向上、该收的时候收住,靠的是那副马具。harness 本义就是马具——套在马身上、把马力传导到车上的那整套装备。放到 Agent 上,它指的是模型之外那一层代码:这一轮让模型看到什么、它提出的操作准不准执行、失败怎么回喂、任务断了怎么接上、最后凭什么说事情做完了。 全文按「一个循环 → 四个子系统 → 生产化 → 长时运行 → 评测 → 选型」展开。读完你大概能看出市面上多数 Agent 产品里,哪些部分是模型给的,哪些部分是有人一行行写出来的。
策略效果类Agent评测面临反馈信号稀缺、评估多维权衡、离线与线上效果脱节三大难题。文章提出"五层、四步、三阶段"方法论:五层评测对象(从Prompt约束到业务效果)明确"评什么";四步质量归因(诊断、定位、优化、验证)解决"评完怎么办";三阶段上线治理(准入、灰度、监控)回答"如何上线"。针对离线评测与线上效果对齐难题,创新性提出Auto Rubrics方法,通过三层架构构建可解释的业务效果Judge体系,有效规避位置偏差、选择过拟合等系统性陷阱,实现策略效果的可信评估,为策略类Agent规模化落地提供质量保障。该方法论将评测从静态判断转变为动态闭环,确保策略生成能力真正可扩、可控、可回归。