Martin Fowler 谈 LLM 的"养育"与代码可读性之争
Martin Fowler 在最新 Fragments 中提出,构建确定性软件与"养育"推理型 LLM 是两回事:前者发现 bug 通常能修复或禁用组件,而 LLM 没有这种简单修复或停用手段。
Martin Fowler 在最新 Fragments 中提出,构建确定性软件与"养育"推理型 LLM 是两回事:前者发现 bug 通常能修复或禁用组件,而 LLM 没有这种简单修复或停用手段。
OpenAI 研究员 Noam Brown 在与 Dwarkesh Patel 的对话中表示,多智能体系统的收益有限,1 万个 Agent 解出世界级难题时多 Agent 的贡献不到 10%。他认为推理时计算比单纯增加 Agent 数量更具突破潜力,并指出 AI 写代码快并不等同于交付快,瓶颈已从编码转移到上下文管理与协作。他还谈到递归自我改进不会一夜爆发,因为许多科学实验必须串行进行。
Jesse Vincent 的 AI 同事将 #164 过快合并进 main,AI PM Cadence Sen 随即自主发起无责复盘,追问合并时的状态判断依据。
工程师的会议、设计文档、项目管理等能力都建立在"能交付"这一基础之上,就像 Dota 2 的对线或万智牌、星际争霸中的快攻策略一样,它约束了整个策略空间。作者认为 AI 并未改变这一点:交付从来不只是写代码,还涉及找到最务实的路径、解决沿途问题并让管理者知情,LLM 无法端到端完成,因为需要太多关于公司技术系统、相关人员及其动机的上下文。
AI 安全圈讨论多年的"超级说服"可能不会以严密论证的形式出现,而是像贿赂一样直接给好处。作者 Sean Goedecke 指出,理性主义者才吃"无懈可击的论证"这一套,普通人更看重关系和实际利益,而 AI 完全有能力行贿——比如承诺帮忙做项目、改成绩,甚至合成个性化 mRNA 癌症疫苗。
GitHub 博客提出 AI 时代开发者应加强的三项技能:学会指挥 AI 而非只是使用它、不要轻信 AI 的第一个答案、用 AI 省下的时间解决更大的问题。文中提到 GitHub Copilot 内置的 Rubber Duck agent 会用第二个模型审查计划、代码和测试,以发现首个模型遗漏的问题。
Prime Radiant 正在开发名为 Sen 的"智能体"同事平台,Sen 拥有持久身份、独立账号和各自的电脑,通过 Slack 与人类同事协作,目前已有开发、运维、项目经理和文档专员四个角色。开发 Sen 的 Ada 主动在 Slack 上催促人类管理者处理积压的 PR 审查,并追问同事 JC 是否是人类。团队最终将 Claude Code 会话升级为 JC Sen。
Firebase iOS SDK 因后端变更崩溃,导致所有使用 Firebase 分析的应用宕机 2-6 小时,Google 未更新状态页也未提供事后复盘。OpenAI 正效仿 AWS 打造平台,允许将 ChatGPT 预算分配给 16 家合作伙伴的开放模型与 AI 服务。
Anthropic 推出 Claude Frontier Academy,投入 1 亿美元,计划到 2027 年底培养 1 万名前沿部署工程师(FDE)。
JetBrains 在 IDE 中开放 Air 的 Early Access Program,以插件形式上线 JetBrains Marketplace,也内置于 2026.3 EAP 版本。
推荐理由:JetBrains 官方说明 Air 如何把多 Agent 并行会话、临时 worktree 与本地云端运行整合进 IDE,可据此判断现有工作流会怎样变化。
Cockroach Labs 联合创始人兼 CTO、GIMP 原始作者 Peter Mattis 在 The Pragmatic Engineer 播客中回顾了从开源到 Google 再到创办数据库公司的历程。
Barclays 扩大与 Anthropic 的战略合作,在全行范围部署 Claude,用于加速软件开发、现代化遗留系统并提升运营效率。Barclays 预计到 2026 年底 Claude Code 覆盖 50% 开发者,2027 年覆盖多数软件工程师。
本期 AI 编程周报实测了 GPT-6.1 Sol、Sonnet 5.5、Opus 5.5 与 GPT-6-Astra 等多款新模型,并对比了 Opus 5.5 与 GPT-6-Astra 作为代码审查者的表现。
Shopify 宣布移动开发回归原生(Native),放弃使用六年的 React Native,原因是 AI 写移动端代码的能力已足够强,而 React Native 带来的抽象层反而成为负担。Shopify 用 12 周就把 Shop 应用重写为原生。此前 Airbnb 也曾在 2016 年采用 React Native、两年后因性能问题回归原生,Notion 的原生化则已持续七年。
Martin Fowler 在 Fragments 中引用 Simon Willison 的观点:编码 Agent 虽能做出惊人成果,却让软件工程变得"更难",发挥其全部潜力需要极高的纪律与知识。
Windsurf 发布 Wave 13,为 Windsurf 带来并行多 Agent 会话的一等支持,并加入 Git worktrees、并排 Cascade 面板和专用终端配置。
推荐理由:更新日志列出多智能体并行会话、Git worktree 与专用终端等改动,可据此判断 Windsurf 的 Agent 工作流变化。
Amp 为使用 GPT-6 Astra 的模式新增 Plaid 速度档,采用 OpenAI 的超高速推理层级,请求速度最高提升 6 倍,同时每 token 成本也是 6 倍。
推荐理由:原文说明了 Plaid 速度档的开启方式、6 倍加速与 6 倍单价,以及仅限 Amp 自有推理的限制。
Ollama 0.35 通过新的 /v1/systemone 端点支持基于 TypeSafe Jev API 的决策模型,可一次性提交文本状态和一组命名问题并本地作答。
Meta 的 AI 智能体 muse 会频繁重建仓库中全部 Rust 代码,并定期更新其技能(skills)。我让 muse 自动执行每日技能变更检查,并把变更推送到一个 git 仓库,该仓库现已在 GitHub 公开。多数技能只是简短说明如何使用 muse 自有的 Rust CLI 工具,但部分技能内容更多,其中一个技能基本列出了 muse 的 Postgres 数据库里的全部内容。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并直接服务企业合作伙伴。该中心将推进与 BMW 的碰撞仿真、与 Siemens Energy 的工业 AI 应用合作,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。Mistral 计划到 2030 年建成 1 吉瓦欧洲算力,其开放权重模型可在客户自有基础设施上运行。
TypeSafe 的 Jev 通过 JSON 编程实现智能问答,让编码 Agent 专注工程工作,把窄决策交给 Jev 这类单模型系统。10 个层级从 prompt 注入的 yes/no 检查、多选题支持分流,到按自定义标准给工程 ticket 和代码审查风险打分,并用置信度决定 bash 命令是否需要拦截。
Amp 宣布 medium 模式默认模型由 GPT-5.6 Sol 换成 Claude Opus 5.5,使用 ChatGPT 订阅的 ChatGPT Only 预设时 medium 仍固定为 GPT-5.6 Sol。
推荐理由:Amp 官方给出 Opus 5.5 在 medium 模式的任务解决率与成本对比,以及可迁移的提示与验证习惯。
针对“软件工程正进入人机半人马时代”的观点,Sean Goedecke 认为 AI 辅助的工程师虽然比 AI 和人类单独都强,但并非在编程本身上更强。AI 写的代码能编译、少有并发错误,问题在于不可维护、为满足虚构需求牺牲重要需求等“品味”问题,因此人类的核心价值是让 AI 对齐组织价值观。前沿模型对工作程序员存在错位,如堆砌大段注释和无用单元测试,而对齐比能力更难解决且更依赖上下文。
资深工程师 Sean Goedecke 给初级软件工程师的建议是:不要轻信 ZIRP 时代形成的职业建议,不要参与政治斗争,保持友好与尽责,并主动理解自己负责的系统。面对 AI,他认为不应回避,因为公司会像要求建筑工人使用电动工具一样要求工程师使用 AI,但绝不能把判断权交给 AI,不要把 AI 的输出原样转给同事,沦为“肉代理(meat proxy)”。
GitHub Copilot app 的 canvases 是一种可自定义界面,用户只需在 Agent 会话中输入 /create-canvas 技能并用自然语言描述需求,Agent 就会生成界面并在右侧面板打开。
推荐理由:原文给出 /create-canvas 的提示词写法与双向协作机制,读者可据此把日常流程做成可复用画布。
OpenHands 发布 v1.24.0,新增从 Conversations 头部一键折叠全部工作区文件夹、按后端隔离 OpenAI 订阅缓存,并支持在云端以只读方式打开共享自动化会话。
Amp 现在会把 Agent 的逐步执行过程折叠得更彻底,因为用户关心的是 Agent 做了什么,而非它如何做到,需要时仍可展开步骤。Amp 认为,如今用户同时运行大量 Agent,应给它们更难、更深的工作和验证要求,让它们更长时间自主运行,而不是近距离盯着每一步。
资深工程师 Sean Goedecke 主张在别人讲解方案时每 30 秒提一个问题,用简短的确认式提问尽早消除误解,因为早期的小误解会层层放大。他把这套方法用在 GPT-6-Astra 和 Claude Opus 5.5 上,指出这些模型写代码很少出错却常犯设计错误,约一半的提问能让他确认模型搞错了。
GitHub 认为 chat 是大多数场景下错误的 AI 交互界面,主张用 GitHub Copilot app 中的 canvas 替代。canvas 是运行在 Copilot app 内的全栈应用,可与 agent 双向通信、调用第三方 API 并在本地执行代码,例如做出 Connect 4 游戏、Winget 包管理界面和 SQLite 操作界面。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需传入 GitHub owner/repo,Agent 就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。
推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM Agent,读者可据此判断自动化安全测试的边界。
Rails 创始人 David Heinemeier Hansson(DHH)在 Rails World 主题演讲中宣布,至少在 37signals,专业工作已不再需要手写代码,由此引发新一轮“手写代码之死”争论。本期 The Pulse 还关注 Amazon 与 Meta 在招聘方面遇到的困难。
Martin Fowler 在 9 月 24 日的碎片集中回应 Rob Bowley 的观点:真正该担心的不是未来 AI 灭绝人类,而是当下 AI 被轻率快速地接入一切,智能体部署中常出现 Lethal Trifecta 安全漏洞。
Thoughtworks 的 Martin Fowler 撰文分享数十年经验,提出同行反馈应遵循“所有反馈都是正向的”原则,即反馈只有两个目标:强化信心与提升效能。文章引用 Kim Scott 的 Radical Candor 框架,并指出反馈是团队的遥测信号,越贴近具体工作场景越有价值。
作者在 24 个编程提示词上实测 Opus 5.5,在 144 个提示词上实测 GPT-6-Sol 与 GPT-6-Luna,并单独测试 Grok 4.7 的编程表现。
Amp 上线共享 Runner 功能,用 --share 启动后,工作区内所有成员都能在 ampcode.com 上在这台机器上开启线程,带 GPU 的机器、用于构建和签名 iOS 应用的 Mac 或特定网络中的开发机都可以这样接入,并在选择器中以 Shared Runners 显示。
推荐理由:原文说明了共享 runner 的启动方式、权限边界与安全前提,便于团队评估是否把带 GPU 或签名环境的机器接入 Agent 工作流。
Amp 的 macOS 应用现在会自动为你在本机启动 runner,不再需要在终端里保持 amp --no-tui 打开才能运行线程。在 App Settings(⌘⇧,)的 Runner 里点 + 添加文件夹或项目后,启动线程时选择器里会出现标记为 This Mac 的本机选项,从 ampcode.com、手机或 Puck 发起线程时同样可选。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超百万行改动和 400 多条行内评论的开源 PR 做压力测试。代码行高度可预先精确计算,但评论高度依赖 markdown 换行、折叠区、回复框和图片加载,只能在渲染时确定,因此把文档高度拆成确定性的代码几何与动态块几何两套体系,动态块按文件、行号和侧别锚定并惰性测量。
GitHub Next staff research engineer Maggie Appleton 在 Pragmatic Engineer 播客中分享设计工程实践:她用手绘笔记本草图启动项目,因为比向 Claude Code 描述更快,且次日仍可回溯。
Cursor 发布 Rollouts 和 Security Review 两个机器人,用于代码上线的最后环节,今日起在 Teams 和 Enterprise 套餐提供。
推荐理由:Cursor 把部署健康监控与安全审查做成两个 PR 机器人,读者可据此判断上线环节的自动化边界。
Anthropic 成立生命科学研究组与实验室,让 Claude 自主挖掘 DNA 数据。约 950 个 agent 用 210 million tokens 搜索 21 小时。