AI 写个人玩具项目很顺手,但落到真实业务里就是另一回事了。这篇整理了我们在打造 AI 原生研发团队上摸出来的一些经验,主要讲四块:通用能力怎么搭、Harness 工程实践、开发跟产品怎么协同。我们希望打破职能边界,让不懂代码的产品同学也能借 AI 东风,自主定义并实现各类内部运营工具,从而带动整个团队的研发效能迈上新台阶。 还有踩完坑之后的一些 Lessons。希望能给大家点参考,尤其是正在琢磨怎么用 AI 把团队能力真正提升起来的同学。
本文介绍了一个面向数据开发团队的数据需求交付 Agent Skill。该技能通过自然语言交互(可以是从 Aone、钉钉消息、PRD 中提取的描述),输出是一份结构化的 Copilot 交互物(prompt),可以直接复制到 DataWorks Copilot 或调用其他大模型中生成高质量 SQL 代码。让数据研发从“依赖人的连续投入的串行排期”转变为“Agent自动执行,人按优先级介入决策的并行推进”。文章从背景痛点、skill介绍、实战场景、核心能力拆解等方面系统展开,并在最后给出总结与展望,希望为同样在做数据质量保障和 Agent 工具落地的开发者提供参考。(文章内容基于作者个人技术实践与独立思考,旨在分享经验,仅代表个人观点。)
本文系统性地回顾了我们在构建企业级 AI Agent 平台过程中走过的完整技术演进路径——从大模型的先天约束出发,经历 Prompt 工程、Context 工程、Harness 工程三个阶段,最终演化出一套五层架构的 Agent 操作系统。每一层的出现都是因为前一层遇到了天花板。(文章内容基于作者个人技术实践与独立思考,旨在分享经验,仅代表个人观点。)
支付宝商家中心(b.alipay.com)是支付宝官方的商家服务平台,面向蚂蚁生态内所有商家,聚合产品签约、账户资金管理、营销运营、账单对账等能力,为商家提供一站式综合服务,帮助其更高效地开展日常经营,我们团队负责该平台的 PC 端业务测试。
本文介绍了“高价率运营 AI 工作台”中基于“约定驱动 + AI 编排”架构的自动化评测优化实践。针对 LLM Agent 场景下传统测试失效、反馈周期长等痛点,文章详细阐述了将评测体系作为核心工程产物的设计方案:通过标准化目录结构固化规范,利用 Coding Agent 实现自然语言驱动的全流程自动化;构建包含真实业务数据驱动的评测集生成、14 个通用维度与专项指标结合的 Rubric 体系、以及采用二元评分机制的 LLM Judge 双引擎架构(auto-evaluation 与 pinchbench-eval)。同时,文章深入剖析了金标设计中的信息隔离、粒度匹配等关键陷阱,并探讨了从半自动向全自动演进过程中,在评测入口、指标自动迭代及记忆机制等方面面临的技术挑战与应对策略,最终实现了将 Skill 可用性从主观判断转化为可量化、可复跑的工程闭环。
交付代码的成本已经接近免费了,但交付好代码的成本依然很高。Harness Engineering 做的事情,就是把"好代码"的标准写进系统里,让 AI 在约束下自己干活。