从记忆到自进化:MemoraX 如何让 Agent 走向 RSI
MemoraX 提出 Memory Model–Driven RSI 方法,由专用记忆模型从 Agent 执行轨迹与在线反馈中提炼、更新程序性记忆,形成经验提炼、任务应用、效果验证与记忆更新的闭环迭代。
MemoraX 提出 Memory Model–Driven RSI 方法,由专用记忆模型从 Agent 执行轨迹与在线反馈中提炼、更新程序性记忆,形成经验提炼、任务应用、效果验证与记忆更新的闭环迭代。
OpenRSI Index 近日在 X 上引发关注,它从 Marin、Qwen、GPIC 等真实开源研究项目出题,让智能体在预训练、后训练与图像生成任务上改进人类设计的训练方案,单次运行算力达 5,815 至 20,864 H100·小时。
八款AI语音输入法横测结果显示,千问输入法识别准确率最高,超过微信输入法,并支持电脑与手机双向剪贴板同步。微信输入法速度最快且免费不限字数,但AI润色偏克制;开源项目OpenLess采用MIT协议、本地优先,模型可自由配置,词典支持按场景切换,适合重度码字用户花20-30分钟配置。作者最终采用千问+叭哥说+Typeless三件套组合,分别覆盖跨设备同步、每周5万字额度和高速AI润色场景。
Google 发布 Android Bench 2.0,新增长周期任务(LHT)、Agent 评测与连续评分,取代此前的二元通过/失败判定。LHT 指需工程师数天甚至一周完成的复杂任务,如升级依赖、从零构建应用、将跨平台应用迁移到 Android。
Cisco 工程师 John Groetzinger 在 AI Native DevCon 演讲中提出,把技能散落到各仓库只会带来上下文漂移和重复劳动,真正需要的是把上下文打包、评测、同步并分发的流水线。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,同日还下调了 Sonnet 5.5 与订阅计划价格。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,便于判断小模型在 Agent 工作流中的成本取舍。
我实测了 Claude、Codex、Cursor 的 $20/月套餐限额,用 10 个编码提示词对比了各家的额度消耗。Matt Pocock Skills v1.3 新增 /retro,可在当前会话结束后改进 Agent 未来会话的表现,我已在真实项目上做了前后对比测试。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 219 个 pull request、覆盖 19 种语言。
推荐理由:GitHub 公开了代码审查基准的构建方法与评分口径,读者可据此判断自家审查 Agent 的强弱项。
Amp 宣布 medium 模式默认模型由 GPT-5.6 Sol 换成 Claude Opus 5.5,使用 ChatGPT 订阅的 ChatGPT Only 预设时 medium 仍固定为 GPT-5.6 Sol。
推荐理由:Amp 官方给出 Opus 5.5 在 medium 模式的任务解决率与成本对比,以及可迁移的提示与验证习惯。
作者在 24 个编程提示词上实测 Opus 5.5,在 144 个提示词上实测 GPT-6-Sol 与 GPT-6-Luna,并单独测试 Grok 4.7 的编程表现。
AI Coding Daily 本周发布 SWE-2 与 DeepSeek v4.1-Flash 在 24 个编码提示词上的实测视频,并重新测试了 Muse Spark 1.3 在 Muse Code MAX 级别的表现。
针对 Artificial Analysis Index 把十个基准压成一个数字、丢失选型信息的问题,IndyDevDan 提出只用五个基准来排名 GPT-6 Astra。
多款新 LLM 密集亮相:GPT-6 Astra 已进入 ChatGPT 应用,Tibo 称其在 low 档推理下表现优于 GPT-5.6 Sol 的 high 档,并因需求空前可能暂停新的 Pro 订阅。同期被测试的还有 Fable 5.1、Omen Alpha、Muse Spark 1.3、Gemini-3.8-Flash 和 Qwen 3.8 Max 0902 版本。
作者用 29 个 LLM 测试代码质量并更新了排行榜,新增 GLM-5.3-Flash(原 Ox Alpha)在 21 个编码提示词上的测试,以及 Qwen 3.8-Flash 在 20 个提示词上的测试。
本周新版 Qwen 3.8 27B 与神秘模型 Ox Alpha 相继亮相,前者在 20 个编码提示词上完成本地 LLM 基准测试,后者已在 OpenCode 上线并测试了不同思考等级。
Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查并核实信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环的工具设计与两组基准数据,可据此判断它相对一次性 RAG 的取舍。
本周多款新模型集中发布:GLM-5.3 主打更少输出 token 与网络安全方向,Grok 4.6 已加入 LLM 排行榜并对比 Cursor 与 API 价格,Gemini 3.7 Flash 在 Antigravity 中实测,DeepSeek-v4-Pro 结束预览并公布涨价。
JetBrains 用 80 组配对任务实测 Claude Code 的 ponytail skill,实测代码量减少 15%、成本降 10.3%、耗时降 11%,约为宣传值(-54% 代码、-22% tokens、-20% 成本、-27% 时间)的四分之一到一半,但这是该系列首个成本节省信号统计上可靠的插件。
JetBrains 用 Claude Code 跑 SkillsBench 的 86 个真实编程任务,对比安装与不安装 Caveman 的效果,发现输出 Token 只从约 59.2 万降到 54.2 万,节省 8.5%,远低于该项目宣称的 65%。