交付代码的成本已经接近免费了,但交付好代码的成本依然很高。Harness Engineering 做的事情,就是把"好代码"的标准写进系统里,让 AI 在约束下自己干活。
过去一个月,我们在搭建一个面向本地生活业务的分析类 Skill,让 AI 能像资深分析师一样做经营诊断、归因拆解和趋势预测。业务覆盖几十个行业,每个行业有独立的经营框架和指标体系,复杂度远超一个 prompt 能承载的范围。搭建过程中,我们经历了三次架构重构(V1 → V2 → V3),每次都是被真实问题逼出来的。这篇文章完整复盘了这个演进过程,最终提炼为六条 Skill 架构设计原则。如果你正在搭建领域知识密集型 Skill,或正面临「prompt 越写越长但效果越来越差」的困境,这篇文章或许能够提供一些思路。每章独立成节,可按需跳读。
淘宝闪购爆品团业务排序模型过去很长一段时间更像是在“堆模块”:遇到一个问题,就补一个结构。短期看,这种方式能持续拿收益,但当模型越做越大,结构碎片化、计算不够稠密、调参成本高等问题会越来越明显。这次爆品团排序模型升级,核心不是再增加一个局部模块,而是把主干从传统 DLRM 架构切到 Token-Based 的 RankMixer 架构。围绕这条主线,我们系统做了负采样、多任务学习、序列建模、Tokenization、FFN、MoE 和 Task Tower 等结构消融。多期迭代后,模型规模从 85M 扩展到 107M,再到 243M,并在爆品团频道页取得了稳定线上收益。
在 ChatGPT 刚出现的时候,它聊起天来似乎无所不知,但一旦你问它:“明天的天气怎么样”,它会告诉你:它无法获得当前最新的信息。它很聪明,却像一个瞎子——你只能让它写写诗、和它聊聊天;想让它做实际的事,它却看不见,动不了。 而在几年后的今天,它已在我们工作的角角落落下场干活!它不再仅是聊天工具,而是真正帮我们解决实际问题。 它如何长出了眼睛和手脚?核心靠的是:Agent(智能体) 和 Skill(技能)。
当客户不再只是人类,当竞争的不再只是流量和注意力,当越来越多的商业流程实现“Human not in the loop”,那些互联网时代习以为常的经验,或许都需要重新学习,甚至主动遗忘。本文中,杨斌教授提出“To A ”这一概念,试图为AI次方时代正在到来的商业新场域,提供一种新的观察框架与思考起点。