从记忆到自进化:MemoraX 如何让 Agent 走向 RSI
MemoraX 提出 Memory Model–Driven RSI 方法,由专用记忆模型从 Agent 执行轨迹与在线反馈中提炼、更新程序性记忆,形成经验提炼、任务应用、效果验证与记忆更新的闭环迭代。
MemoraX 提出 Memory Model–Driven RSI 方法,由专用记忆模型从 Agent 执行轨迹与在线反馈中提炼、更新程序性记忆,形成经验提炼、任务应用、效果验证与记忆更新的闭环迭代。
Anthropic 发布 Claude Motion 完整上手指南,动效视频不再依赖视频大模型,而是由 Opus 5.5 在 Claude Code 中调用 HyperFrames 框架编写动效代码并直接渲染导出 MP4。
八款AI语音输入法横测结果显示,千问输入法识别准确率最高,超过微信输入法,并支持电脑与手机双向剪贴板同步。微信输入法速度最快且免费不限字数,但AI润色偏克制;开源项目OpenLess采用MIT协议、本地优先,模型可自由配置,词典支持按场景切换,适合重度码字用户花20-30分钟配置。作者最终采用千问+叭哥说+Typeless三件套组合,分别覆盖跨设备同步、每周5万字额度和高速AI润色场景。
宝玉分享了开源项目 baocut 的完整开发流程:先由 Agent 分析调研并撰写技术方案文档,反复沟通定稿后生成高保真 UI 原型,再基于文档进入编码。在 baocut 完善字幕样式功能时,他用 AI Agent 快速迭代 UI 设计,并由 Agent 运行自动化测试用例,防止新功能破坏现有系统,最后人工检查自动化无法覆盖的边缘情况。
Claude Code 2.1.296 为 Claude apps gateway 的 managed.policies[] 新增 code 键,与 cli 配置相同并应用于 Claude Desktop 的 Code 标签页,同时开启 Desktop 的 gateway 模式。
Tessl 发布 Tessl Code Review,把代码审查拆成标准、视角、发现、裁决、逐条回应和记忆六个部分,并内置正确性与数据完整性、安全与隐私、规模与韧性、可维护性与代码质量四个并行 lens。
Netflix 可观测性团队分享了如何用本体(ontology)驱动的方式构建端到端知识图谱,把传统被动监控改造成主动洞察引擎,目标是在整个技术栈中自动检测、按用户影响排序、自动分派并定位根因,甚至提前预测问题。其规模背景是峰值 6500 万并发流、每日超 20 亿请求、每秒超 3800 万条实时日志事件。
Asana 的 StackAI CTO Frank Hidalgo 用 Codex 中的 GPT-6 Astra 做实验,把浏览器 Agent 工作流优化到在 GPT-6.1 Sol 上运行成本降低 76 倍、速度提升 5 倍,单次运行平均约 0.47 美元、约 4 分钟。
Superpowers 在首次公开发布一周年之际推出 7.0,最大变化是完全重建的头脑风暴体验,更擅长帮用户理清和表达想做的产品,也更愿意在用户目标明确时让编码 Agent 直接干活。
豆包工作配合 Remotion 技能,可在云端自动写代码渲染动态视频,无需本地剪辑软件和 Node.js 环境。实测中它通读 Transformer 论文生成 10 个分镜、自动修复 TypeScript 引号错误并重渲,还从飞书文档解析 26 张图片,产出 120 秒 1080P 30 帧成片。该流程可沉淀为「SR动态视频」技能复用,新用户登录电脑端可领 30 天会员。
Tessl 把一场 AI Native DevCon 演讲变成 Agent 可调用的技能上下文。演讲者用 OpenClaw、GitHub 仓库、Obsidian 和 Telegram 搭建"组织大脑",通过 cron job 每天推送 agentic engineering 相关研究更新,研究库约 1200 个文件,并另设客户信息库供自然语言查询。
Liran Tal 在 AI Native DevCon London 的演讲中指出,Agent Skills 不只是给人类看的 markdown,一旦被 Agent 信任就能影响其读取内容、调用工具和访问工作区,因此应被视为供应链组件。
Mozilla.ai 在 AI Native DevCon London 上介绍了 cq 项目,目标是解决智能体反复重新发现同一缺失知识的问题。cq 以"知识单元"为基本单位,记录智能体遇到非显而易见问题后找到的解决方案,包含领域、洞察、采取的行动及可选元数据,供其他智能体按需查询。cq 默认本地运行,使用本地 SQLite 数据库,数据无需离开本机,之后可连接远程服务器构建带审查的团队级知识库。
Cisco 工程师 John Groetzinger 在 AI Native DevCon 演讲中提出,把技能散落到各仓库只会带来上下文漂移和重复劳动,真正需要的是把上下文打包、评测、同步并分发的流水线。
Tessl 在 AI Native DevCon London 提出,AI 编码 Agent 让 PR 变多却卡在代码审查,根因是缺乏验证层。其方案是把规格转成可执行检查:一个 Agent 做规划拆解需求与边界情况,多个验证 Agent 并行逐条核对预览环境,再由编排器汇总报告。审查需同时基于规格与代码,并优先对照 base branch 而非仅看 diff。
GitHub Next 的 Don Syme 提出在 CI 和 CD 之外增加第三根支柱 Continuous AI,即由仓库事件或定时触发的自动化 AI 工作流,用于持续文档、代码改进、问题分诊和故障分析。
VarOps 的 Ran Aroussi 复盘了为跨组织 Agent 构建记忆系统的经验,认为把记忆当作存储的 retrieve、stuff、hope 做法在生产中会以四种方式失效。
腾讯WorkBuddy新增独立文件浏览器,在本地文件上右键选择用WorkBuddy打开,即可弹出左文件、右AI对话的独立窗口,并支持把文件上传到知识库。它支持多标签页且每个文件的AI对话上下文独立,Office文件改完可直接存回原文件、不产生新副本,Markdown实时渲染并自动保存,HTML也能看能改。小程序版同样可打开.md和.html文件,查看和编辑文件不消耗积分,仅与AI对话才扣。
Spotify Ads 高级工程师 Pratik Rasam 在 QCon AI 分享了 Spotify Ads Manager 内部多 Agent 平台 Ads AI 的生产实践:上线以来超 70% 的广告使用 AI 工具,为 7000 多家广告主生成约 2 万个创意。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,同日还下调了 Sonnet 5.5 与订阅计划价格。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,便于判断小模型在 Agent 工作流中的成本取舍。
《Building Microservices》作者 Sam Newman 在新书《Building Resilient Distributed Systems》中提出分布式系统三法则:信息传输需要时间、资源可能离线、资源并非无限,并指出多数故障源于资源耗尽。
我实测了 Claude、Codex、Cursor 的 $20/月套餐限额,用 10 个编码提示词对比了各家的额度消耗。Matt Pocock Skills v1.3 新增 /retro,可在当前会话结束后改进 Agent 未来会话的表现,我已在真实项目上做了前后对比测试。
代码与英文文本不同,其顺序由计算机执行逻辑决定,且通常以 diff 形式被阅读,结构复杂度也远超自然语言。作者主张采用“dyadic scanning”式多轮跳读:先追踪关键调用路径理清结构,再逐行细读,把其余部分当作黑盒。他认为 LLM 生成的代码仍必须人工审查,因为常见问题不是 bug 而是对齐偏差,例如为无害的竞态条件生成三千行复杂改动。
The Pragmatic Engineer 在 LDX3 工程领导力大会的主题演讲给出 2026 年科技行业快照:几乎没人再手写代码,同时运行 5-10 个 Agent 已成常态,IDE 正在淡化。
Pi 作者 Armin Ronacher 撰文解释 Codemode:让 LLM 在 harness 侧用 JavaScript 编排工具调用,而不必把工具定义塞进上下文。
Amp 的 Puck 现已支持开启多个独立会话,每个会话拥有各自的 Puck,点 + 即可新建,点击顶部会话名可切换。三天未使用的会话会被移入 Inactive,以保持列表简洁。
Martin Fowler 在最新 Fragments 中提出,构建确定性软件与"养育"推理型 LLM 是两回事:前者发现 bug 通常能修复或禁用组件,而 LLM 没有这种简单修复或停用手段。
OpenAI 研究员 Noam Brown 在与 Dwarkesh Patel 的对话中表示,多智能体系统的收益有限,1 万个 Agent 解出世界级难题时多 Agent 的贡献不到 10%。他认为推理时计算比单纯增加 Agent 数量更具突破潜力,并指出 AI 写代码快并不等同于交付快,瓶颈已从编码转移到上下文管理与协作。他还谈到递归自我改进不会一夜爆发,因为许多科学实验必须串行进行。
GitHub 博客提出 AI 时代开发者应加强的三项技能:学会指挥 AI 而非只是使用它、不要轻信 AI 的第一个答案、用 AI 省下的时间解决更大的问题。文中提到 GitHub Copilot 内置的 Rubber Duck agent 会用第二个模型审查计划、代码和测试,以发现首个模型遗漏的问题。
Cockroach Labs 联合创始人兼 CTO、GIMP 原始作者 Peter Mattis 在 The Pragmatic Engineer 播客中回顾了从开源到 Google 再到创办数据库公司的历程。
Meta 的 AI 智能体 muse 会频繁重建仓库中全部 Rust 代码,并定期更新其技能(skills)。我让 muse 自动执行每日技能变更检查,并把变更推送到一个 git 仓库,该仓库现已在 GitHub 公开。多数技能只是简短说明如何使用 muse 自有的 Rust CLI 工具,但部分技能内容更多,其中一个技能基本列出了 muse 的 Postgres 数据库里的全部内容。
TypeSafe 的 Jev 通过 JSON 编程实现智能问答,让编码 Agent 专注工程工作,把窄决策交给 Jev 这类单模型系统。10 个层级从 prompt 注入的 yes/no 检查、多选题支持分流,到按自定义标准给工程 ticket 和代码审查风险打分,并用置信度决定 bash 命令是否需要拦截。
Amp 宣布 medium 模式默认模型由 GPT-5.6 Sol 换成 Claude Opus 5.5,使用 ChatGPT 订阅的 ChatGPT Only 预设时 medium 仍固定为 GPT-5.6 Sol。
推荐理由:Amp 官方给出 Opus 5.5 在 medium 模式的任务解决率与成本对比,以及可迁移的提示与验证习惯。
针对“软件工程正进入人机半人马时代”的观点,Sean Goedecke 认为 AI 辅助的工程师虽然比 AI 和人类单独都强,但并非在编程本身上更强。AI 写的代码能编译、少有并发错误,问题在于不可维护、为满足虚构需求牺牲重要需求等“品味”问题,因此人类的核心价值是让 AI 对齐组织价值观。前沿模型对工作程序员存在错位,如堆砌大段注释和无用单元测试,而对齐比能力更难解决且更依赖上下文。
GitHub Copilot app 的 canvases 是一种可自定义界面,用户只需在 Agent 会话中输入 /create-canvas 技能并用自然语言描述需求,Agent 就会生成界面并在右侧面板打开。
推荐理由:原文给出 /create-canvas 的提示词写法与双向协作机制,读者可据此把日常流程做成可复用画布。
Amp 现在会把 Agent 的逐步执行过程折叠得更彻底,因为用户关心的是 Agent 做了什么,而非它如何做到,需要时仍可展开步骤。Amp 认为,如今用户同时运行大量 Agent,应给它们更难、更深的工作和验证要求,让它们更长时间自主运行,而不是近距离盯着每一步。
资深工程师 Sean Goedecke 主张在别人讲解方案时每 30 秒提一个问题,用简短的确认式提问尽早消除误解,因为早期的小误解会层层放大。他把这套方法用在 GPT-6-Astra 和 Claude Opus 5.5 上,指出这些模型写代码很少出错却常犯设计错误,约一半的提问能让他确认模型搞错了。
Martin Fowler 在 9 月 24 日的碎片集中回应 Rob Bowley 的观点:真正该担心的不是未来 AI 灭绝人类,而是当下 AI 被轻率快速地接入一切,智能体部署中常出现 Lethal Trifecta 安全漏洞。
作者在 24 个编程提示词上实测 Opus 5.5,在 144 个提示词上实测 GPT-6-Sol 与 GPT-6-Luna,并单独测试 Grok 4.7 的编程表现。
GitHub Next staff research engineer Maggie Appleton 在 Pragmatic Engineer 播客中分享设计工程实践:她用手绘笔记本草图启动项目,因为比向 Claude Code 描述更快,且次日仍可回溯。