本文提出了一种适用于扩散模型的全新引导范式——自交换引导(Self-Swap Guidance, SSG)。针对传统引导方法(如 CFG 或其他无条件引导机制)高度依赖文本条件、需专门训练或直接加噪导致图像失真的局限性,SSG 提出了一种“无需文本、不加噪声、不改模型”的轻量化策略。 其核心思想是在模型推理阶段,直接对内部特征(Token)在空间和通道维度上进行“最不相似”特征对的交换,以此为模型引入结构性扰动生成一条“变差”的预测路径,再利用差值反向指导模型朝更高质量的方向生成。 实验表明,SSG 在有条件和无条件生图任务中均更具鲁棒性,多项图像质量和文本一致性指标超越了现有的无条件引导方法。 该工作由vivo BlueImage Lab,上海交通大学共同完成。
在存量项目的增量开发中,AI 常常面临理解偏差、执行不稳、需要频繁纠正等问题。本文介绍自建的「OpenSpec 规范层 + AI Workflows 执行层」体系,通过一套「规范 + 技能 + 钩子」机制,对 AI 的理解、执行和校验进行系统化约束与增强,显著提升开发协作中的准确率与稳定性,让 AI 从“需要反复纠正的实习生”逐步成长为“可信赖的开发搭档”,文中附完整实战案例。
从 ReAct 出发,文章讨论 Agent 工程如何从“模型循环”走向 Harness:通过前后端共享的 State Schema、运行事实和 UI 边界,让模型行为变成可交互、可恢复、可控制、可追溯的产品能力。
在不手写一行代码的情况下,用自然语言指挥 BlueCode AI 编程助手,在 2 个工作日内完成了一个 4 年历史、2 万行 Vue 项目的全面重构——157+ 个文件变更、108 个单元测试从零建立、包体积下降 30%、Element Plus 完全移除。文章的核心观点是:AI 辅助开发的关键不在 AI 本身的能力,而在于人为 AI 建立的约束体系——通过 Skills 技能包注入领域知识、AGENTS.md 沉淀项目规范、飞轮效应让错误只犯一次,将模糊目标转化为 AI 可精确执行的高质量指令,从提出需求到代码合入,甚至本篇分享也是AI生成。
推荐系统擅长回答“推什么”,用户却卡在“怎么选”。 本文探索:不改排序,补上排序之后的“表达与决策”——把游戏理解透,让同类多款可比较、可解释、可追溯。做法是让大模型放开探索、用工程约束收住,使生成稳定进生产。目标不是替代排序,而是帮用户从“给结果”走向“帮决策”。
本文介绍了一种基于 search_after + Redis 多级锚点缓存的Elasticsearch深度分页跳页方案。针对Elasticsearch原生不支持随机跳页的限制,通过三轮优化——分段预热缓存、最近锚点定位 + Elasticsearch查询提速(禁用 _source/关闭 track_total_hits)、大区间预热 + 小分页精细锚点——将 50 万数据量下的任意跳页响应时间从 10 分钟级优化至 1 秒以内。
本文以“大模型不是马,而是大脑”为核心视角,重新定义 AI 系统结构,指出当前问题不在模型能力,而在 Agent 作为“身体”的不成熟,分析感知、行动、反馈与调度等工程缺陷,并将 Harness 类系统比作 ICU 的生命维持机制,强调当下混乱源于最佳实践尚未收敛,认为当前阶段本质是“不会用工具”的早期,人类正在通过实践逐步定义 AI 的正确使用方式。
本文介绍 vivo 线下门店「大头贴」拍照合成打印一体化桌面应用软件的技术方案。该项目基于 Tauri 2.0 + Rust + Vue 3 构建,实现了手机实时投屏、智能拍照、Live Photo 处理、模板合成、视频生成、跨平台打印等核心能力,为门店用户提供沉浸式拍照体验。
MagicWorld 针对当前视频世界模型在长时间交互中易出现运动不合理与场景崩坏的问题,提出了一种面向长时稳定性的交互式建模框架。该方法通过引入基于光流的运动约束提升动态真实性,利用历史检索机制增强跨时间一致性,并通过多步聚合的训练策略优化整体交互序列质量,从而有效缓解误差累积问题。整体上,MagicWorld 实现了在长时间交互下更加稳定、一致的世界生成能力。
最近在做知识库问答输入框的 @文档 能力,表面上是“输入 @ 后选一个文档”的小需求,实操后发现核心难点在于编辑器稳定性。本文按真实心路历程展开:先讲最直觉的 DOM 方案与踩坑,再讲为什么转向 ProseMirror,并给出 @文档 的落地实现。