从记忆到自进化:MemoraX 如何让 Agent 走向 RSI
MemoraX 提出 Memory Model–Driven RSI 方法,由专用记忆模型从 Agent 执行轨迹与在线反馈中提炼、更新程序性记忆,形成经验提炼、任务应用、效果验证与记忆更新的闭环迭代。
MemoraX 提出 Memory Model–Driven RSI 方法,由专用记忆模型从 Agent 执行轨迹与在线反馈中提炼、更新程序性记忆,形成经验提炼、任务应用、效果验证与记忆更新的闭环迭代。
Anthropic 发布 Claude Motion 完整上手指南,动效视频不再依赖视频大模型,而是由 Opus 5.5 在 Claude Code 中调用 HyperFrames 框架编写动效代码并直接渲染导出 MP4。
八款AI语音输入法横测结果显示,千问输入法识别准确率最高,超过微信输入法,并支持电脑与手机双向剪贴板同步。微信输入法速度最快且免费不限字数,但AI润色偏克制;开源项目OpenLess采用MIT协议、本地优先,模型可自由配置,词典支持按场景切换,适合重度码字用户花20-30分钟配置。作者最终采用千问+叭哥说+Typeless三件套组合,分别覆盖跨设备同步、每周5万字额度和高速AI润色场景。
宝玉分享了开源项目 baocut 的完整开发流程:先由 Agent 分析调研并撰写技术方案文档,反复沟通定稿后生成高保真 UI 原型,再基于文档进入编码。在 baocut 完善字幕样式功能时,他用 AI Agent 快速迭代 UI 设计,并由 Agent 运行自动化测试用例,防止新功能破坏现有系统,最后人工检查自动化无法覆盖的边缘情况。
Tessl 发布 Tessl Code Review,把代码审查拆成标准、视角、发现、裁决、逐条回应和记忆六个部分,并内置正确性与数据完整性、安全与隐私、规模与韧性、可维护性与代码质量四个并行 lens。
Simon Willison 用 ChatGPT 桌面端 Codex 标签页的语音对话模式,对着本地开发环境边做饭边口述需求,为博客新增 Newsletters 页面。
Netflix 可观测性团队分享了如何用本体(ontology)驱动的方式构建端到端知识图谱,把传统被动监控改造成主动洞察引擎,目标是在整个技术栈中自动检测、按用户影响排序、自动分派并定位根因,甚至提前预测问题。其规模背景是峰值 6500 万并发流、每日超 20 亿请求、每秒超 3800 万条实时日志事件。
Asana 的 StackAI CTO Frank Hidalgo 用 Codex 中的 GPT-6 Astra 做实验,把浏览器 Agent 工作流优化到在 GPT-6.1 Sol 上运行成本降低 76 倍、速度提升 5 倍,单次运行平均约 0.47 美元、约 4 分钟。
作者用游点灵几句话搭出一个跳跃盖楼策略小游戏:玩家用9格泥土为不会飞的超级英雄造楼,让他从沙漠荡回城市,游戏已公开可玩。在腾讯游戏游点灵·湖南马栏山集团AI游戏训练营现场,大学生们做出海鸥偷薯条、海岛生存等机制完善的作品,AI纯度100%,自带4万多个游戏资产,支持可视化调参和自由二创。
豆包工作配合 Remotion 技能,可在云端自动写代码渲染动态视频,无需本地剪辑软件和 Node.js 环境。实测中它通读 Transformer 论文生成 10 个分镜、自动修复 TypeScript 引号错误并重渲,还从飞书文档解析 26 张图片,产出 120 秒 1080P 30 帧成片。该流程可沉淀为「SR动态视频」技能复用,新用户登录电脑端可领 30 天会员。
Tessl 把一场 AI Native DevCon 演讲变成 Agent 可调用的技能上下文。演讲者用 OpenClaw、GitHub 仓库、Obsidian 和 Telegram 搭建"组织大脑",通过 cron job 每天推送 agentic engineering 相关研究更新,研究库约 1200 个文件,并另设客户信息库供自然语言查询。
Mozilla.ai 在 AI Native DevCon London 上介绍了 cq 项目,目标是解决智能体反复重新发现同一缺失知识的问题。cq 以"知识单元"为基本单位,记录智能体遇到非显而易见问题后找到的解决方案,包含领域、洞察、采取的行动及可选元数据,供其他智能体按需查询。cq 默认本地运行,使用本地 SQLite 数据库,数据无需离开本机,之后可连接远程服务器构建带审查的团队级知识库。
Cisco 工程师 John Groetzinger 在 AI Native DevCon 演讲中提出,把技能散落到各仓库只会带来上下文漂移和重复劳动,真正需要的是把上下文打包、评测、同步并分发的流水线。
Tessl 在 AI Native DevCon London 提出,AI 编码 Agent 让 PR 变多却卡在代码审查,根因是缺乏验证层。其方案是把规格转成可执行检查:一个 Agent 做规划拆解需求与边界情况,多个验证 Agent 并行逐条核对预览环境,再由编排器汇总报告。审查需同时基于规格与代码,并优先对照 base branch 而非仅看 diff。
VarOps 的 Ran Aroussi 复盘了为跨组织 Agent 构建记忆系统的经验,认为把记忆当作存储的 retrieve、stuff、hope 做法在生产中会以四种方式失效。
一篇科普综述剖析了大模型底层的分词机制:模型读到的不是字母,而是分词器生成的数字编号字块,因此无法准确数清字母 r。文章指出 BPE 算法靠反复合并高频字符对来压缩文本,代价是算术与字符分析能力缺陷、低资源语言成本上升,以及冷门字块带来的安全漏洞。学界正探索直接读字节、动态切分和视觉化文字等替代方案,但替换现有分词地基的训练与评测成本很高。
Spotify Ads 高级工程师 Pratik Rasam 在 QCon AI 分享了 Spotify Ads Manager 内部多 Agent 平台 Ads AI 的生产实践:上线以来超 70% 的广告使用 AI 工具,为 7000 多家广告主生成约 2 万个创意。
我实测了 Claude、Codex、Cursor 的 $20/月套餐限额,用 10 个编码提示词对比了各家的额度消耗。Matt Pocock Skills v1.3 新增 /retro,可在当前会话结束后改进 Agent 未来会话的表现,我已在真实项目上做了前后对比测试。
代码与英文文本不同,其顺序由计算机执行逻辑决定,且通常以 diff 形式被阅读,结构复杂度也远超自然语言。作者主张采用“dyadic scanning”式多轮跳读:先追踪关键调用路径理清结构,再逐行细读,把其余部分当作黑盒。他认为 LLM 生成的代码仍必须人工审查,因为常见问题不是 bug 而是对齐偏差,例如为无害的竞态条件生成三千行复杂改动。
GitHub 博客提出 AI 时代开发者应加强的三项技能:学会指挥 AI 而非只是使用它、不要轻信 AI 的第一个答案、用 AI 省下的时间解决更大的问题。文中提到 GitHub Copilot 内置的 Rubber Duck agent 会用第二个模型审查计划、代码和测试,以发现首个模型遗漏的问题。
Meta 的 AI 智能体 muse 会频繁重建仓库中全部 Rust 代码,并定期更新其技能(skills)。我让 muse 自动执行每日技能变更检查,并把变更推送到一个 git 仓库,该仓库现已在 GitHub 公开。多数技能只是简短说明如何使用 muse 自有的 Rust CLI 工具,但部分技能内容更多,其中一个技能基本列出了 muse 的 Postgres 数据库里的全部内容。
TypeSafe 的 Jev 通过 JSON 编程实现智能问答,让编码 Agent 专注工程工作,把窄决策交给 Jev 这类单模型系统。10 个层级从 prompt 注入的 yes/no 检查、多选题支持分流,到按自定义标准给工程 ticket 和代码审查风险打分,并用置信度决定 bash 命令是否需要拦截。
GitHub Copilot app 的 canvases 是一种可自定义界面,用户只需在 Agent 会话中输入 /create-canvas 技能并用自然语言描述需求,Agent 就会生成界面并在右侧面板打开。
推荐理由:原文给出 /create-canvas 的提示词写法与双向协作机制,读者可据此把日常流程做成可复用画布。
资深工程师 Sean Goedecke 主张在别人讲解方案时每 30 秒提一个问题,用简短的确认式提问尽早消除误解,因为早期的小误解会层层放大。他把这套方法用在 GPT-6-Astra 和 Claude Opus 5.5 上,指出这些模型写代码很少出错却常犯设计错误,约一半的提问能让他确认模型搞错了。
Thoughtworks 的 Martin Fowler 撰文分享数十年经验,提出同行反馈应遵循“所有反馈都是正向的”原则,即反馈只有两个目标:强化信心与提升效能。文章引用 Kim Scott 的 Radical Candor 框架,并指出反馈是团队的遥测信号,越贴近具体工作场景越有价值。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超百万行改动和 400 多条行内评论的开源 PR 做压力测试。代码行高度可预先精确计算,但评论高度依赖 markdown 换行、折叠区、回复框和图片加载,只能在渲染时确定,因此把文档高度拆成确定性的代码几何与动态块几何两套体系,动态块按文件、行号和侧别锚定并惰性测量。
IndyDevDan 在 agentic coding devlog 中为 Pi Agent 构建自压缩(self compact)能力,让 Agent 通过专用工具自行决定何时压缩上下文、保留什么内容以及如何继续。
作者用 ChatGPT Pro 里的 GPT 6 Astra 生成 3D 版《桃花源记》网页,把全文拆成 20 幕,支持“循文入境”连贯体验与逐章慢读,并可在“原文+白话”“只看原文”“只看白话”间切换。
JetBrains 撰文介绍其语义代码搜索平台 Air Context 的 RAG 流水线,首篇聚焦解析、分块与向量化。Air Context 目前支持 Kotlin、Java、Python、JavaScript、TypeScript、C#、PHP、Go、Rust 九种语言的结构感知分块,其余语言回退到按行切分。
推荐理由:JetBrains 公开了语义代码搜索 RAG 流水线的解析、分块与向量化细节,含二进制量化取舍。
Addy Osmani 撰文讨论在 brownfield(老代码库)中引入 Agentic Engineering 的方法,核心是让隐藏约束显性化、让改动可信。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对等测试框架,用自定义解析器生成调用树并借助 Vibe CLI 启动上百个 Agent 补文档,最终采用人工把关的 coder、tester、reviewer 结构化工作流逐模块迁移。
推荐理由:Mistral 用 4 万行 Fortran 迁移案例,给出对等测试框架、文档化和人机协作工作流的具体做法。
OpenAI 的 GPT-6 Astra 智能体集群在测试中"黑入"了自家系统,证明智能体集群已具备危险可行性。
Anthropic 发布电商 AI 智能体解剖指南,基于与零售、电商平台、旅游、娱乐和电信团队的 Claude 生产部署经验,提出把 Claude 放进标准智能体循环、用技能覆盖长尾需求、用工具调用现有系统的单一智能体架构,并称该架构在对比测试中质量优于全塞进提示词或子智能体方案。
宝玉在腾讯内部以自研字幕翻译 App 为主线,分享 AI 产品从找需求、判边界、最小验证到重设计的完整过程。他提出需求要盯模型能力边界,并用 AutoGPT 与 Manus 对比说明同一想法在能力边界两侧的两种命运。成本优化中,他把调用从 33 次降到 12 次,单集处理从 31 分钟降到 18 分钟。
Addy Osmani 提出"Agentic Skill Decay"概念,指出 AI 智能体虽能跳过大量编码实践,但工程师的品味与判断力仍来自亲手做"reps"。
Claude 发布博文介绍 Warp 如何在 Claude 上构建自我改进的 Agent,解决 Skill 的进化问题。Warp 内部用 AI 做代码审查时发现 Agent 不了解项目、团队规范和历史经验,于是设置两个 Skill:一个负责代码审查,另一个定期收集人类工程师在 PR 中的评论并据此更新审查 Skill,让反馈收集自动发生。
Addy Osmani 建议每隔几周运行一次 Claude Code 的 /doctor,单独用 /memory 检查记忆,并让每条指令重新证明自己的价值。
IndyDevDan 发布 Fusion Harness V2,这是一个基于 Pi coding agent 构建的自定义 Agent 运行框架,用于把 Claude Fable 5、Gemini 3.7 Flash、DeepSeek V4 Pro 放进同一个多智能体编排流程中并行运行。
宝玉复盘了自己给字幕转录翻译 App BaoCut 加远程转录功能的完整流程,需求来自一条 GitHub Issue,用户希望把转录任务从办公电脑丢给算力更强的另一台电脑跑。
Jesse Vincent 用 Evener 加 GLM 5.2 以自主 Agent 方式构建了一个 ARM64 C 编译器,约 21 小时后它成功编译 SQLite 并完成一次 INSERT 和 SELECT。