IndyDevDan 为 Pi Agent 构建自压缩工具,对比 Claude Code 与 Codex
IndyDevDan 在 agentic coding devlog 中为 Pi Agent 构建自压缩(self compact)能力,让 Agent 通过专用工具自行决定何时压缩上下文、保留什么内容以及如何继续。
IndyDevDan 在 agentic coding devlog 中为 Pi Agent 构建自压缩(self compact)能力,让 Agent 通过专用工具自行决定何时压缩上下文、保留什么内容以及如何继续。
作者用 ChatGPT Pro 里的 GPT 6 Astra 生成 3D 版《桃花源记》网页,把全文拆成 20 幕,支持“循文入境”连贯体验与逐章慢读,并可在“原文+白话”“只看原文”“只看白话”间切换。
GitHub Podcast 最新一期拆解了五个 AI 热门论断:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决的是不同问题,前者是可读的打包经验,后者是连接工具与数据的标准接口,二者可组合使用。
JetBrains 撰文介绍其语义代码搜索平台 Air Context 的 RAG 流水线,首篇聚焦解析、分块与向量化。Air Context 目前支持 Kotlin、Java、Python、JavaScript、TypeScript、C#、PHP、Go、Rust 九种语言的结构感知分块,其余语言回退到按行切分。
推荐理由:JetBrains 公开了语义代码搜索 RAG 流水线的解析、分块与向量化细节,含二进制量化取舍。
Zed 团队发布 Delta 公测版,这是一个与 Agent 协作编码并审查其产出的多人环境,支持 macOS、Linux、Windows 和网页端,移动浏览器也可跟进线程。
推荐理由:Zed 团队把 PR 换成 Delta 线程,并公开了自用数据,可据此判断协作式 Agent 编码的另一种组织方式。
Armin Ronacher 用 Opus 5 按 David Sacks 推文的结构生成了一段 8 段、350 词以内的文本,Pangram 判定其为 100% AI 生成。随后他逐段人工改写,与原文相似度约 50%、无一句相同,仅用 LLM 修正错别字。Pangram 自称误判人类文本为 AI 的比例为 0.0041%,漏检 AI 文本为 0.34%。
Addy Osmani 撰文讨论在 brownfield(老代码库)中引入 Agentic Engineering 的方法,核心是让隐藏约束显性化、让改动可信。
Cursor 推出 Projects,用于承接功能开发、迁移或完整应用等更大规模的工作,可跨数月维持上下文、把任务分派给大量子 Agent,并在无需提示的情况下执行周期性工作。
推荐理由:官方说明 Projects 如何用协调者 Agent 与云端并行子 Agent 承接跨月的大型开发任务,可据此判断长周期工作流的组织方式。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对等测试框架,用自定义解析器生成调用树并借助 Vibe CLI 启动上百个 Agent 补文档,最终采用人工把关的 coder、tester、reviewer 结构化工作流逐模块迁移。
推荐理由:Mistral 用 4 万行 Fortran 迁移案例,给出对等测试框架、文档化和人机协作工作流的具体做法。
OpenAI 的 GPT-6 Astra 智能体集群在测试中"黑入"了自家系统,证明智能体集群已具备危险可行性。
Armin Ronacher 用 GPT 6 Astra 跑了一个周末的无人值守软件工厂,35 小时产出 75k 行代码、79 个 commit、约 1B tokens(约 1200 美元 API 成本),但没有交付任何有价值的东西。
Armin Ronacher 想给廉价 CarPlay 车机棒刷第三方固件,通过 Pi 与 LLM 对话得知了用 Rust 重写 CarPlay 协议的 CatPlay,并让 Kimi K3 和 Sol 帮忙搞定刷机与为对应 SoC 编译。
作者用 29 个 LLM 测试代码质量并更新了排行榜,新增 GLM-5.3-Flash(原 Ox Alpha)在 21 个编码提示词上的测试,以及 Qwen 3.8-Flash 在 20 个提示词上的测试。
Anthropic 发布电商 AI 智能体解剖指南,基于与零售、电商平台、旅游、娱乐和电信团队的 Claude 生产部署经验,提出把 Claude 放进标准智能体循环、用技能覆盖长尾需求、用工具调用现有系统的单一智能体架构,并称该架构在对比测试中质量优于全塞进提示词或子智能体方案。
Zed 认为 Ted Nelson 的 Xanadu 超文本构想之所以长期无法落地,是因为缺少能耐心追踪每一层引用的用户,而 AI 智能体正好补上这一环。DeltaDB 用 Lamport 时间戳、Merkle 树、CRDT、廉价存储、常连网络和 Firecracker 级微虚拟机等六十年积累的组件,实现"永不复制、只引用,永不覆盖、只版本化"的 xanalogical 计算。
IndyDevDan 提出 Agentic Engineering Operating Level 框架,把工程师和 Agent 可操作的层级分为五级:Code Primitives、Code Structure、Data and Execution、Delivery and Intent、Agentic Systems。
宝玉在腾讯内部以自研字幕翻译 App 为主线,分享 AI 产品从找需求、判边界、最小验证到重设计的完整过程。他提出需求要盯模型能力边界,并用 AutoGPT 与 Manus 对比说明同一想法在能力边界两侧的两种命运。成本优化中,他把调用从 33 次降到 12 次,单集处理从 31 分钟降到 18 分钟。
Addy Osmani 提出"Agentic Skill Decay"概念,指出 AI 智能体虽能跳过大量编码实践,但工程师的品味与判断力仍来自亲手做"reps"。
Claude 发布博文介绍 Warp 如何在 Claude 上构建自我改进的 Agent,解决 Skill 的进化问题。Warp 内部用 AI 做代码审查时发现 Agent 不了解项目、团队规范和历史经验,于是设置两个 Skill:一个负责代码审查,另一个定期收集人类工程师在 PR 中的评论并据此更新审查 Skill,让反馈收集自动发生。
Addy Osmani 建议每隔几周运行一次 Claude Code 的 /doctor,单独用 /memory 检查记忆,并让每条指令重新证明自己的价值。
Steve Yegge 每月花费约 12.2 万美元 API token(约每天 4000 美元),使用 21 个 Claude Max 账号,并以每周 2 个的速度增长,用于开发他做了 30 年的游戏 Wyvern。
IndyDevDan 发布 Fusion Harness V2,这是一个基于 Pi coding agent 构建的自定义 Agent 运行框架,用于把 Claude Fable 5、Gemini 3.7 Flash、DeepSeek V4 Pro 放进同一个多智能体编排流程中并行运行。
宝玉复盘了自己给字幕转录翻译 App BaoCut 加远程转录功能的完整流程,需求来自一条 GitHub Issue,用户希望把转录任务从办公电脑丢给算力更强的另一台电脑跑。
Addy Osmani 认为软件工厂是围绕软件工作的可重复循环,但可交付的代码仍需人类品味与所有权,人类应前置决定产品意图、系统设计和质量标准。他指出用 Claude Code 或 Codex 配合多会话、带验证的 SPEC 和约束就能走很远,只有当系统需要可重复、事件驱动时才值得建工厂。
Jesse Vincent 用 Evener 加 GLM 5.2 以自主 Agent 方式构建了一个 ARM64 C 编译器,约 21 小时后它成功编译 SQLite 并完成一次 INSERT 和 SELECT。
Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查并核实信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环的工具设计与两组基准数据,可据此判断它相对一次性 RAG 的取舍。
本周多款新模型集中发布:GLM-5.3 主打更少输出 token 与网络安全方向,Grok 4.6 已加入 LLM 排行榜并对比 Cursor 与 API 价格,Gemini 3.7 Flash 在 Antigravity 中实测,DeepSeek-v4-Pro 结束预览并公布涨价。
Cursor 发布云 Agent 与 Harness 更新,云 Agent 可订阅 PR、Slack 线程或定时任务等事件源,被触发后自动唤醒并持续推进目标。新增 Custom Modes 可把技能固定在对话中,子 Agent 可运行在各自独立的虚拟机与干净上下文中,用于测试父 Agent 改动或并行修复。还加入 /goal 设定长期目标,以及不打断 Agent 的转向消息机制。
推荐理由:官方更新日志列出云 Agent 订阅事件、子 Agent 独立虚拟机与 /goal 等能力,可据此判断常驻 Agent 的编排方式。
IndyDevDan 发布视频,演示用系统提示词工程把啰嗦的 Claude Opus 5 改造成精确的资深工程师,并称系统提示词比用户提示词和技能更具杠杆。
Addy Osmani 结合自己每天并行运行 5 到 10 个 Agent 的经验,梳理 Claude Code 中 goal 与 loop 两类原语的分工:goal 用可度量的完成条件驱动单个任务迭代,loop 按固定间隔重跑提示词,适合轮询 PR、CI 和日志等场景。
Zed 团队发布 Delta,一个面向与 Agent 协作编码和评审的多人环境,首批用户已进入私测。Delta 基于自研 DeltaDB,把对话与 worktree 一起实时复制,兼容现有 git 仓库,未使用 Delta 的同事看到的仍是普通 repo。Delta 还支持把线程分享为链接在浏览器打开,并已接入第三方 Agent 运行框架,首个是 Claude Code。
推荐理由:Zed 团队把 DeltaDB 的实时协作能力做成独立应用,读者可据此判断多人加 Agent 的代码评审会怎么变。
Addy Osmani 提出,Agent 每天产生数十万乃至上百万次代码变更,逐行代码审查已不可行,软件质量转而取决于围绕 Agent 设置的约束,即质量门禁。这些门禁包括单元测试、属性测试、验收测试、变异测试,以及圈复杂度和行长等代码质量指标,并贯穿 Agent 从解释器到控制器再到生产的全流程。人类注意力应只投向自动化护栏失效时的复杂问题,否则会拖慢机器速度的流程。
JetBrains 用 80 组配对任务实测 Claude Code 的 ponytail skill,实测代码量减少 15%、成本降 10.3%、耗时降 11%,约为宣传值(-54% 代码、-22% tokens、-20% 成本、-27% 时间)的四分之一到一半,但这是该系列首个成本节省信号统计上可靠的插件。
针对 @cellier_ 提出的通用 Agent 吃掉垂直 Agent、开放吃掉封闭、下沉吃掉傲慢三个判断,宝玉补充了自己的六点看法:通用 Agent 赛道本身也会是少数赢家通吃,小通用 Agent 同样没有生存空间;开放与封闭的差别不在开源或模型切换,而在插件生态,Skill 加 MCP 是关键。
JetBrains 发布 JetBrains Context,一个面向编码 Agent 的仓库智能层,现已随 JetBrains AI 订阅开放早期访问且不额外收费、不消耗配额。
推荐理由:JetBrains 官方给出仓库智能层的接入方式与三项基准降幅,可据此判断编码 Agent 在大型代码库中的成本变化。
Addy Osmani 提出软件工厂由循环、Harness、工厂三层构成:循环是单个 Agent 重复执行任务的最小单元,Harness 是沙箱、工具、记忆与完成判定,工厂则是多个 Harness 化循环共用一个审查门。明工厂保留人类判断,暗工厂让 Agent 自行定范围、构建并发布代码,无人阅读细节。他指出图中生成、测试、扫描几乎零成本,唯一难以扩展的是审查门这一"判断"环节。
Prime Radiant 在其 agentic harness Sen 中引入 Therapist 模式,由独立 subagent 负责修改 persona,是唯一拥有 mutable-identity 写权限的角色。
Addy Osmani 在 AI Engineer World's Fair 2026 闭幕演讲中提出,工程师必须掌控智能体工程的"外循环",即对系统负责。他将智能体定义为模型加 Harness,循环为调查、实现、验证、重复,工厂则是规模化运行的循环。
JetBrains 用 Claude Code 跑 SkillsBench 的 86 个真实编程任务,对比安装与不安装 Caveman 的效果,发现输出 Token 只从约 59.2 万降到 54.2 万,节省 8.5%,远低于该项目宣称的 65%。
Zed 发布 Hidden Gems 第 4 期,介绍居中布局、多项目键盘导航、集成终端中设置 EDITOR 为 zed --wait、命令别名和用大纲面板查看搜索结果等技巧。