• ARTICLE
  • STRING
  • CONVERTER
  • ENCRYPT
  • NETWORK
  • MORE
    CHART
    MATH
    COORDINATE
    IMAGE
    FILE
    OPEN API
  • ARTICLE
    STRING
    CONVERTER
    ENCRYPT
    NETWORK
    MORE
    CHART
    MATH
    COORDINATE
    IMAGE
    FILE
    OPEN API
logo Online Tools
All Chinese English Newest Hottest
1940 search results

Agent 越改越乱之后,我用评测和轨迹把它拉回来了

10 Technology lddgo Shared on 2026-08-13

连续五天登上 GitHub Trending 首页的思考

16 Technology lddgo Shared on 2026-08-12

天猫AI助手团队通过“调度框架重构”与“AI Coding工程化”双轮驱动,在两周内将底层架构从硬编码升级为基于Reducer/Event的三层调度模型,实现了状态写入收敛、可观测性独立通道及业务接入效率的大幅提升;同时建立包含范式、Skill、Hook及观测报告的AI工程化闭环,将单业务接入成本从3.5–4.5人天降至约0.7人天,验证了将隐性知识显式化为组织工程能力对于应对业务泛化迭代及穿越模型代际更迭的核心价值。

8 Technology lddgo Shared on 2026-08-12

Qoder CLI 上运行 Qwen3.8-Max:5 个硬核任务实测

7 Technology lddgo Shared on 2026-08-12

很多人查日志,都是从一条告警开始的。接口报错了,先搜 Request ID;Pod 重启了,去找退出前的异常堆栈;用户反馈支付失败,再拿着账号和订单号回查调用过程。此时问题已经发生,日志帮助我们还原现场。但日志里留下的东西远不止故障现场。应用日志记录业务执行过程,访问日志反映流量和服务质量,审计日志记录谁在什么时间做了什么操作,Kubernetes Event 记录资源状态变化。研发用它排障,安全团队用它审计,运营团队也可以从中发现支付、库存、设备或用户行为的异常。真正容易被忽略的,是那些还没有触发告警、也没有人主动搜索的变化:一个新版本开始零星出现从未见过的异常堆栈;整体错误率看起来正常,某个 Region 却在持续恶化;一类高风险操作第一次出现在非授权时间。单独看,这些信号可能并不起眼。继续发展下去,它们也可能成为下一次大面积故障的起点。日志智能巡检要做的,是在没人提问的时候主动看一遍,并告诉我们:这里出现了一个过去没有的变化,值得现在就查。

8 Technology lddgo Shared on 2026-08-12

本文旨在解决传统AI评测仅关注相关性而忽略因果性的局限,引入数据科学中的因果推断与博弈论方法进行归因分析,以精准量化LLM及Agent系统中各组件对结果的真实贡献度。文章首先厘清了相关性与因果性的区别,介绍了Rubin潜在结果模型与Pearl因果图两大理论框架,以及DoWhy、EconML、SHAP等主流工具库;随后针对AI评测场景,构建了基于完整Trace日志的高精度组件级归因、无中间数据时的扰动式黑盒归因、以及控制混杂变量的因果推断A/B测试三种实战策略,并通过具体案例演示了如何定位工具选择、参数构造、Prompt设计及Query复杂度等因素的影响;最后总结了当前面临的挑战、算法优化方向及常见陷阱,强调通过剥离混杂变量和量化纯净贡献度,实现从“发生了什么”到“为什么发生”及“如何优化”的深度洞察,从而精准定位系统瓶颈并指导迭代优化。

22 Technology lddgo Shared on 2026-08-10

本文介绍了淘宝主播Agent的Harness工程实战,旨在通过构建模型外层的工程化“骨架”解决大模型在高风险、高并发直播场景中不可控、易漂移的问题。文章首先定义了由执行循环、工具注册、上下文管理、状态存储、生命周期钩子和评估接口组成的Harness六元组,并确立了框架层兜底安全与状态、业务层专注技能开发的分层架构,采用MySQL、Hologres和GitLab分别存储会话、记忆和技能以实现逻辑统一与物理分治。在具体实践中,通过分层压缩与Reducer模式优化上下文,利用Schema强约束、幂等设计及五层纵深防御体系保障工具调用安全,引入沙箱隔离执行风险,并以DAG全局规划替代ReAct单步决策以提升长程任务的恢复性与效率。此外,文章详细阐述了基于会话、事实、行为三层结构的记忆体系,通过记忆对账机制与信任度演化算法,实现了Agent对主播偏好的精准理解与自适应输出,最终将不确定的模型能力转化为可用、可控、可演化的工业级产品。

61 Technology lddgo Shared on 2026-08-07

(和 LLM 相关的)Memory 是一个被广泛关注和讨论的话题,其中,参数化 Memory 是 Memory 的一个重要分支。但是在众多的谈论中,我发现很多文章对于“参数化 Memory”这个概念的理解并不一致,比如认为“只要训练了一个记忆特化的模型,就归类为参数化 Memory 研究”。甚至在写下这篇文章之前,我也很难系统性地理解参数化记忆的本质是什么、难点如何,以及它和 LLM 的关系如何。因此,本文主要是梳理一些脉络,尝试从头理解参数化,以及理解记忆。故称为:“漫谈”(偏教学向、学习向)。

57 Technology lddgo Shared on 2026-08-07

该文介绍了复杂业务场景下AI研发交付的实践方案,团队将流程分为三阶段,重点打造第一阶段底座。通过分层知识库设计(main全局业务、applications应用知识、candidate候选知识、personal个人经验、template模板),确保AI获取准确上下文;采用文件化的RD流程,用Markdown承载需求分析、拆解、实现校验全过程,使研发状态可接续、可review;前置质量门禁,在PRD验证、需求澄清、方案设计等关键节点设置人机协同review点,避免后期高成本返工。不追求100%全AI交付,强调AI负责分析实现、人聚焦关键判断,通过知识沉淀与流程规范提升整体交付质量与稳定性,为后续自动化和多Agent协同奠定基础。

40 Technology lddgo Shared on 2026-08-05

从 Agent Flow 到 AI Native:为什么通用 Agent 是“饮鸩止渴”

31 Technology lddgo Shared on 2026-08-05