从记忆到自进化:MemoraX 如何让 Agent 走向 RSI
MemoraX 提出 Memory Model–Driven RSI 方法,由专用记忆模型从 Agent 执行轨迹与在线反馈中提炼、更新程序性记忆,形成经验提炼、任务应用、效果验证与记忆更新的闭环迭代。
MemoraX 提出 Memory Model–Driven RSI 方法,由专用记忆模型从 Agent 执行轨迹与在线反馈中提炼、更新程序性记忆,形成经验提炼、任务应用、效果验证与记忆更新的闭环迭代。
Anthropic 发布 Claude Motion 完整上手指南,动效视频不再依赖视频大模型,而是由 Opus 5.5 在 Claude Code 中调用 HyperFrames 框架编写动效代码并直接渲染导出 MP4。
八款AI语音输入法横测结果显示,千问输入法识别准确率最高,超过微信输入法,并支持电脑与手机双向剪贴板同步。微信输入法速度最快且免费不限字数,但AI润色偏克制;开源项目OpenLess采用MIT协议、本地优先,模型可自由配置,词典支持按场景切换,适合重度码字用户花20-30分钟配置。作者最终采用千问+叭哥说+Typeless三件套组合,分别覆盖跨设备同步、每周5万字额度和高速AI润色场景。
宝玉分享了开源项目 baocut 的完整开发流程:先由 Agent 分析调研并撰写技术方案文档,反复沟通定稿后生成高保真 UI 原型,再基于文档进入编码。在 baocut 完善字幕样式功能时,他用 AI Agent 快速迭代 UI 设计,并由 Agent 运行自动化测试用例,防止新功能破坏现有系统,最后人工检查自动化无法覆盖的边缘情况。
Tessl 发布 Tessl Code Review,把代码审查拆成标准、视角、发现、裁决、逐条回应和记忆六个部分,并内置正确性与数据完整性、安全与隐私、规模与韧性、可维护性与代码质量四个并行 lens。
Simon Willison 用 ChatGPT 桌面端 Codex 标签页的语音对话模式,对着本地开发环境边做饭边口述需求,为博客新增 Newsletters 页面。
Netflix 可观测性团队分享了如何用本体(ontology)驱动的方式构建端到端知识图谱,把传统被动监控改造成主动洞察引擎,目标是在整个技术栈中自动检测、按用户影响排序、自动分派并定位根因,甚至提前预测问题。其规模背景是峰值 6500 万并发流、每日超 20 亿请求、每秒超 3800 万条实时日志事件。
Asana 的 StackAI CTO Frank Hidalgo 用 Codex 中的 GPT-6 Astra 做实验,把浏览器 Agent 工作流优化到在 GPT-6.1 Sol 上运行成本降低 76 倍、速度提升 5 倍,单次运行平均约 0.47 美元、约 4 分钟。
作者用游点灵几句话搭出一个跳跃盖楼策略小游戏:玩家用9格泥土为不会飞的超级英雄造楼,让他从沙漠荡回城市,游戏已公开可玩。在腾讯游戏游点灵·湖南马栏山集团AI游戏训练营现场,大学生们做出海鸥偷薯条、海岛生存等机制完善的作品,AI纯度100%,自带4万多个游戏资产,支持可视化调参和自由二创。
豆包工作配合 Remotion 技能,可在云端自动写代码渲染动态视频,无需本地剪辑软件和 Node.js 环境。实测中它通读 Transformer 论文生成 10 个分镜、自动修复 TypeScript 引号错误并重渲,还从飞书文档解析 26 张图片,产出 120 秒 1080P 30 帧成片。该流程可沉淀为「SR动态视频」技能复用,新用户登录电脑端可领 30 天会员。
Tessl 把一场 AI Native DevCon 演讲变成 Agent 可调用的技能上下文。演讲者用 OpenClaw、GitHub 仓库、Obsidian 和 Telegram 搭建"组织大脑",通过 cron job 每天推送 agentic engineering 相关研究更新,研究库约 1200 个文件,并另设客户信息库供自然语言查询。
Mozilla.ai 在 AI Native DevCon London 上介绍了 cq 项目,目标是解决智能体反复重新发现同一缺失知识的问题。cq 以"知识单元"为基本单位,记录智能体遇到非显而易见问题后找到的解决方案,包含领域、洞察、采取的行动及可选元数据,供其他智能体按需查询。cq 默认本地运行,使用本地 SQLite 数据库,数据无需离开本机,之后可连接远程服务器构建带审查的团队级知识库。
Cisco 工程师 John Groetzinger 在 AI Native DevCon 演讲中提出,把技能散落到各仓库只会带来上下文漂移和重复劳动,真正需要的是把上下文打包、评测、同步并分发的流水线。
Tessl 在 AI Native DevCon London 提出,AI 编码 Agent 让 PR 变多却卡在代码审查,根因是缺乏验证层。其方案是把规格转成可执行检查:一个 Agent 做规划拆解需求与边界情况,多个验证 Agent 并行逐条核对预览环境,再由编排器汇总报告。审查需同时基于规格与代码,并优先对照 base branch 而非仅看 diff。
VarOps 的 Ran Aroussi 复盘了为跨组织 Agent 构建记忆系统的经验,认为把记忆当作存储的 retrieve、stuff、hope 做法在生产中会以四种方式失效。
一篇科普综述剖析了大模型底层的分词机制:模型读到的不是字母,而是分词器生成的数字编号字块,因此无法准确数清字母 r。文章指出 BPE 算法靠反复合并高频字符对来压缩文本,代价是算术与字符分析能力缺陷、低资源语言成本上升,以及冷门字块带来的安全漏洞。学界正探索直接读字节、动态切分和视觉化文字等替代方案,但替换现有分词地基的训练与评测成本很高。
Spotify Ads 高级工程师 Pratik Rasam 在 QCon AI 分享了 Spotify Ads Manager 内部多 Agent 平台 Ads AI 的生产实践:上线以来超 70% 的广告使用 AI 工具,为 7000 多家广告主生成约 2 万个创意。
我实测了 Claude、Codex、Cursor 的 $20/月套餐限额,用 10 个编码提示词对比了各家的额度消耗。Matt Pocock Skills v1.3 新增 /retro,可在当前会话结束后改进 Agent 未来会话的表现,我已在真实项目上做了前后对比测试。
代码与英文文本不同,其顺序由计算机执行逻辑决定,且通常以 diff 形式被阅读,结构复杂度也远超自然语言。作者主张采用“dyadic scanning”式多轮跳读:先追踪关键调用路径理清结构,再逐行细读,把其余部分当作黑盒。他认为 LLM 生成的代码仍必须人工审查,因为常见问题不是 bug 而是对齐偏差,例如为无害的竞态条件生成三千行复杂改动。
GitHub 博客提出 AI 时代开发者应加强的三项技能:学会指挥 AI 而非只是使用它、不要轻信 AI 的第一个答案、用 AI 省下的时间解决更大的问题。文中提到 GitHub Copilot 内置的 Rubber Duck agent 会用第二个模型审查计划、代码和测试,以发现首个模型遗漏的问题。
Meta 的 AI 智能体 muse 会频繁重建仓库中全部 Rust 代码,并定期更新其技能(skills)。我让 muse 自动执行每日技能变更检查,并把变更推送到一个 git 仓库,该仓库现已在 GitHub 公开。多数技能只是简短说明如何使用 muse 自有的 Rust CLI 工具,但部分技能内容更多,其中一个技能基本列出了 muse 的 Postgres 数据库里的全部内容。
TypeSafe 的 Jev 通过 JSON 编程实现智能问答,让编码 Agent 专注工程工作,把窄决策交给 Jev 这类单模型系统。10 个层级从 prompt 注入的 yes/no 检查、多选题支持分流,到按自定义标准给工程 ticket 和代码审查风险打分,并用置信度决定 bash 命令是否需要拦截。
GitHub Copilot app 的 canvases 是一种可自定义界面,用户只需在 Agent 会话中输入 /create-canvas 技能并用自然语言描述需求,Agent 就会生成界面并在右侧面板打开。
推荐理由:原文给出 /create-canvas 的提示词写法与双向协作机制,读者可据此把日常流程做成可复用画布。
资深工程师 Sean Goedecke 主张在别人讲解方案时每 30 秒提一个问题,用简短的确认式提问尽早消除误解,因为早期的小误解会层层放大。他把这套方法用在 GPT-6-Astra 和 Claude Opus 5.5 上,指出这些模型写代码很少出错却常犯设计错误,约一半的提问能让他确认模型搞错了。
Thoughtworks 的 Martin Fowler 撰文分享数十年经验,提出同行反馈应遵循“所有反馈都是正向的”原则,即反馈只有两个目标:强化信心与提升效能。文章引用 Kim Scott 的 Radical Candor 框架,并指出反馈是团队的遥测信号,越贴近具体工作场景越有价值。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超百万行改动和 400 多条行内评论的开源 PR 做压力测试。代码行高度可预先精确计算,但评论高度依赖 markdown 换行、折叠区、回复框和图片加载,只能在渲染时确定,因此把文档高度拆成确定性的代码几何与动态块几何两套体系,动态块按文件、行号和侧别锚定并惰性测量。
IndyDevDan 在 agentic coding devlog 中为 Pi Agent 构建自压缩(self compact)能力,让 Agent 通过专用工具自行决定何时压缩上下文、保留什么内容以及如何继续。
作者用 ChatGPT Pro 里的 GPT 6 Astra 生成 3D 版《桃花源记》网页,把全文拆成 20 幕,支持“循文入境”连贯体验与逐章慢读,并可在“原文+白话”“只看原文”“只看白话”间切换。
JetBrains 撰文介绍其语义代码搜索平台 Air Context 的 RAG 流水线,首篇聚焦解析、分块与向量化。Air Context 目前支持 Kotlin、Java、Python、JavaScript、TypeScript、C#、PHP、Go、Rust 九种语言的结构感知分块,其余语言回退到按行切分。
推荐理由:JetBrains 公开了语义代码搜索 RAG 流水线的解析、分块与向量化细节,含二进制量化取舍。
Addy Osmani 撰文讨论在 brownfield(老代码库)中引入 Agentic Engineering 的方法,核心是让隐藏约束显性化、让改动可信。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对等测试框架,用自定义解析器生成调用树并借助 Vibe CLI 启动上百个 Agent 补文档,最终采用人工把关的 coder、tester、reviewer 结构化工作流逐模块迁移。
推荐理由:Mistral 用 4 万行 Fortran 迁移案例,给出对等测试框架、文档化和人机协作工作流的具体做法。
OpenAI 的 GPT-6 Astra 智能体集群在测试中"黑入"了自家系统,证明智能体集群已具备危险可行性。
Anthropic 发布电商 AI 智能体解剖指南,基于与零售、电商平台、旅游、娱乐和电信团队的 Claude 生产部署经验,提出把 Claude 放进标准智能体循环、用技能覆盖长尾需求、用工具调用现有系统的单一智能体架构,并称该架构在对比测试中质量优于全塞进提示词或子智能体方案。
宝玉在腾讯内部以自研字幕翻译 App 为主线,分享 AI 产品从找需求、判边界、最小验证到重设计的完整过程。他提出需求要盯模型能力边界,并用 AutoGPT 与 Manus 对比说明同一想法在能力边界两侧的两种命运。成本优化中,他把调用从 33 次降到 12 次,单集处理从 31 分钟降到 18 分钟。
Claude 发布博文介绍 Warp 如何在 Claude 上构建自我改进的 Agent,解决 Skill 的进化问题。Warp 内部用 AI 做代码审查时发现 Agent 不了解项目、团队规范和历史经验,于是设置两个 Skill:一个负责代码审查,另一个定期收集人类工程师在 PR 中的评论并据此更新审查 Skill,让反馈收集自动发生。
Addy Osmani 建议每隔几周运行一次 Claude Code 的 /doctor,单独用 /memory 检查记忆,并让每条指令重新证明自己的价值。
IndyDevDan 发布 Fusion Harness V2,这是一个基于 Pi coding agent 构建的自定义 Agent 运行框架,用于把 Claude Fable 5、Gemini 3.7 Flash、DeepSeek V4 Pro 放进同一个多智能体编排流程中并行运行。
宝玉复盘了自己给字幕转录翻译 App BaoCut 加远程转录功能的完整流程,需求来自一条 GitHub Issue,用户希望把转录任务从办公电脑丢给算力更强的另一台电脑跑。
Jesse Vincent 用 Evener 加 GLM 5.2 以自主 Agent 方式构建了一个 ARM64 C 编译器,约 21 小时后它成功编译 SQLite 并完成一次 INSERT 和 SELECT。
IndyDevDan 发布视频,演示用系统提示词工程把啰嗦的 Claude Opus 5 改造成精确的资深工程师,并称系统提示词比用户提示词和技能更具杠杆。