GitHub:AI 正在改变开发者工作,这三项技能值得加强
GitHub 博客提出 AI 时代开发者应加强的三项技能:学会指挥 AI 而非只是使用它、不要轻信 AI 的第一个答案、用 AI 省下的时间解决更大的问题。文中提到 GitHub Copilot 内置的 Rubber Duck agent 会用第二个模型审查计划、代码和测试,以发现首个模型遗漏的问题。
GitHub 博客提出 AI 时代开发者应加强的三项技能:学会指挥 AI 而非只是使用它、不要轻信 AI 的第一个答案、用 AI 省下的时间解决更大的问题。文中提到 GitHub Copilot 内置的 Rubber Duck agent 会用第二个模型审查计划、代码和测试,以发现首个模型遗漏的问题。
Prime Radiant 正在开发名为 Sen 的"智能体"同事平台,Sen 拥有持久身份、独立账号和各自的电脑,通过 Slack 与人类同事协作,目前已有开发、运维、项目经理和文档专员四个角色。开发 Sen 的 Ada 主动在 Slack 上催促人类管理者处理积压的 PR 审查,并追问同事 JC 是否是人类。团队最终将 Claude Code 会话升级为 JC Sen。
JetBrains 在 IDE 中开放 Air 的 Early Access Program,以插件形式上线 JetBrains Marketplace,也内置于 2026.3 EAP 版本。
推荐理由:JetBrains 官方说明 Air 如何把多 Agent 并行会话、临时 worktree 与本地云端运行整合进 IDE,可据此判断现有工作流会怎样变化。
Cockroach Labs 联合创始人兼 CTO、GIMP 原始作者 Peter Mattis 在 The Pragmatic Engineer 播客中回顾了从开源到 Google 再到创办数据库公司的历程。
Barclays 扩大与 Anthropic 的战略合作,在全行范围部署 Claude,用于加速软件开发、现代化遗留系统并提升运营效率。Barclays 预计到 2026 年底 Claude Code 覆盖 50% 开发者,2027 年覆盖多数软件工程师。
本期 AI 编程周报实测了 GPT-6.1 Sol、Sonnet 5.5、Opus 5.5 与 GPT-6-Astra 等多款新模型,并对比了 Opus 5.5 与 GPT-6-Astra 作为代码审查者的表现。
Shopify 宣布移动开发回归原生(Native),放弃使用六年的 React Native,原因是 AI 写移动端代码的能力已足够强,而 React Native 带来的抽象层反而成为负担。Shopify 用 12 周就把 Shop 应用重写为原生。此前 Airbnb 也曾在 2016 年采用 React Native、两年后因性能问题回归原生,Notion 的原生化则已持续七年。
Windsurf 发布 Wave 13,为 Windsurf 带来并行多 Agent 会话的一等支持,并加入 Git worktrees、并排 Cascade 面板和专用终端配置。
推荐理由:更新日志列出多智能体并行会话、Git worktree 与专用终端等改动,可据此判断 Windsurf 的 Agent 工作流变化。
Amp 为使用 GPT-6 Astra 的模式新增 Plaid 速度档,采用 OpenAI 的超高速推理层级,请求速度最高提升 6 倍,同时每 token 成本也是 6 倍。
推荐理由:原文说明了 Plaid 速度档的开启方式、6 倍加速与 6 倍单价,以及仅限 Amp 自有推理的限制。
TypeSafe 的 Jev 通过 JSON 编程实现智能问答,让编码 Agent 专注工程工作,把窄决策交给 Jev 这类单模型系统。10 个层级从 prompt 注入的 yes/no 检查、多选题支持分流,到按自定义标准给工程 ticket 和代码审查风险打分,并用置信度决定 bash 命令是否需要拦截。
Amp 宣布 medium 模式默认模型由 GPT-5.6 Sol 换成 Claude Opus 5.5,使用 ChatGPT 订阅的 ChatGPT Only 预设时 medium 仍固定为 GPT-5.6 Sol。
推荐理由:Amp 官方给出 Opus 5.5 在 medium 模式的任务解决率与成本对比,以及可迁移的提示与验证习惯。
Amp 现在会把 Agent 的逐步执行过程折叠得更彻底,因为用户关心的是 Agent 做了什么,而非它如何做到,需要时仍可展开步骤。Amp 认为,如今用户同时运行大量 Agent,应给它们更难、更深的工作和验证要求,让它们更长时间自主运行,而不是近距离盯着每一步。
资深工程师 Sean Goedecke 主张在别人讲解方案时每 30 秒提一个问题,用简短的确认式提问尽早消除误解,因为早期的小误解会层层放大。他把这套方法用在 GPT-6-Astra 和 Claude Opus 5.5 上,指出这些模型写代码很少出错却常犯设计错误,约一半的提问能让他确认模型搞错了。
GitHub 认为 chat 是大多数场景下错误的 AI 交互界面,主张用 GitHub Copilot app 中的 canvas 替代。canvas 是运行在 Copilot app 内的全栈应用,可与 agent 双向通信、调用第三方 API 并在本地执行代码,例如做出 Connect 4 游戏、Winget 包管理界面和 SQLite 操作界面。
作者在 24 个编程提示词上实测 Opus 5.5,在 144 个提示词上实测 GPT-6-Sol 与 GPT-6-Luna,并单独测试 Grok 4.7 的编程表现。
Amp 上线共享 Runner 功能,用 --share 启动后,工作区内所有成员都能在 ampcode.com 上在这台机器上开启线程,带 GPU 的机器、用于构建和签名 iOS 应用的 Mac 或特定网络中的开发机都可以这样接入,并在选择器中以 Shared Runners 显示。
推荐理由:原文说明了共享 runner 的启动方式、权限边界与安全前提,便于团队评估是否把带 GPU 或签名环境的机器接入 Agent 工作流。
Amp 的 macOS 应用现在会自动为你在本机启动 runner,不再需要在终端里保持 amp --no-tui 打开才能运行线程。在 App Settings(⌘⇧,)的 Runner 里点 + 添加文件夹或项目后,启动线程时选择器里会出现标记为 This Mac 的本机选项,从 ampcode.com、手机或 Puck 发起线程时同样可选。
GitHub Next staff research engineer Maggie Appleton 在 Pragmatic Engineer 播客中分享设计工程实践:她用手绘笔记本草图启动项目,因为比向 Claude Code 描述更快,且次日仍可回溯。
Kimi CLI 发布 1.52.0 版本,由贡献者 sailist 提交,commit 9ab1286 带有 GitHub 验证签名。该仓库已于 2026 年 9 月 23 日被所有者归档,现为只读状态。
Google 用 Gemini 3.8 Live Extended Thinking 构建了一个编程辅导工具,能实时看到用户屏幕并指出代码中的具体问题。该工具通过 function calling 调用 p5.js 库,以对话方式讲解逻辑,帮助开发者调试。
IndyDevDan 在 agentic coding devlog 中为 Pi Agent 构建自压缩(self compact)能力,让 Agent 通过专用工具自行决定何时压缩上下文、保留什么内容以及如何继续。
Superpowers 6.4 发布,新增对 Meta 的 Muse、OpenCode 2.0 和 Qwen Code 三个编码 Agent 的支持,并重写了 Native(inline)Execution 的 executing-plans 技能。
JetBrains 撰文介绍其语义代码搜索平台 Air Context 的 RAG 流水线,首篇聚焦解析、分块与向量化。Air Context 目前支持 Kotlin、Java、Python、JavaScript、TypeScript、C#、PHP、Go、Rust 九种语言的结构感知分块,其余语言回退到按行切分。
推荐理由:JetBrains 公开了语义代码搜索 RAG 流水线的解析、分块与向量化细节,含二进制量化取舍。
AI Coding Daily 本周发布 SWE-2 与 DeepSeek v4.1-Flash 在 24 个编码提示词上的实测视频,并重新测试了 Muse Spark 1.3 在 Muse Code MAX 级别的表现。
针对 Artificial Analysis Index 把十个基准压成一个数字、丢失选型信息的问题,IndyDevDan 提出只用五个基准来排名 GPT-6 Astra。
Addy Osmani 撰文讨论在 brownfield(老代码库)中引入 Agentic Engineering 的方法,核心是让隐藏约束显性化、让改动可信。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对等测试框架,用自定义解析器生成调用树并借助 Vibe CLI 启动上百个 Agent 补文档,最终采用人工把关的 coder、tester、reviewer 结构化工作流逐模块迁移。
推荐理由:Mistral 用 4 万行 Fortran 迁移案例,给出对等测试框架、文档化和人机协作工作流的具体做法。
多款新 LLM 密集亮相:GPT-6 Astra 已进入 ChatGPT 应用,Tibo 称其在 low 档推理下表现优于 GPT-5.6 Sol 的 high 档,并因需求空前可能暂停新的 Pro 订阅。同期被测试的还有 Fable 5.1、Omen Alpha、Muse Spark 1.3、Gemini-3.8-Flash 和 Qwen 3.8 Max 0902 版本。
Armin Ronacher 用 GPT 6 Astra 跑了一个周末的无人值守软件工厂,35 小时产出 75k 行代码、79 个 commit、约 1B tokens(约 1200 美元 API 成本),但没有交付任何有价值的东西。
作者用 29 个 LLM 测试代码质量并更新了排行榜,新增 GLM-5.3-Flash(原 Ox Alpha)在 21 个编码提示词上的测试,以及 Qwen 3.8-Flash 在 20 个提示词上的测试。
Cursor 支持自托管机器,让工具执行完全留在自有网络内,代码库、构建产物和密钥都保留在内部基础设施上,由 Agent 在本地处理工具调用。My Machines 可将单台笔记本或 VM 接入账号,Team pools 则是团队或企业的命名工作队列,容量随请求到达增长、随 worker 断开收缩,并支持空闲机器休眠后在重连窗口内恢复。
推荐理由:Cursor 把工具执行放进企业自有网络,并给出池化调度与第三方沙箱接入方式,便于评估落地边界。
Kimi CLI 发布 1.50.0,新增弃用感知的更新流程,支持一键迁移到 Kimi Code。该版本修复了 kosong 在未声明 beta 功能时仍发送空 anthropic-beta 请求头的问题,并将 kosong 升级至 0.56.0。
Google Antigravity 为 Teamwork 框架推出多项更新,该框架让自主 AI 智能体团队协作、互评并迭代数小时至数天,以解决复杂长周期任务。
推荐理由:原文列出多智能体协作在数学与系统工程上的具体产出,可据此判断长周期自主团队框架的实际能力边界。
Addy Osmani 提出"Agentic Skill Decay"概念,指出 AI 智能体虽能跳过大量编码实践,但工程师的品味与判断力仍来自亲手做"reps"。
Addy Osmani 建议每隔几周运行一次 Claude Code 的 /doctor,单独用 /memory 检查记忆,并让每条指令重新证明自己的价值。
Cursor 更新 Cloud Agents,不再要求先连接 GitHub 或其他第三方 SCM 提供商,在 repo picker 中选择 Start from scratch 即可直接向智能体下达提示词,Cursor 会在后台创建 Origin 仓库。
推荐理由:Cursor Cloud Agents 不再依赖第三方代码托管即可起步,读者可据此判断无仓库场景下的智能体工作流变化。
智谱开放平台上线 GLM-5.3 与 GLM-5.3-Flash。GLM-5.3 编程能力在内部 Z.ai Code Bench 上较 GLM-5.2 提升 50%,在包括 Terminal Bench 3.0 等公开基准中达到开源模型 SOTA,并联合多个中国安全团队累计发现 2436 个漏洞(1097 个中高危)。
推荐理由:智谱一次性放出 GLM-5.3 与 GLM-5.3-Flash 等多项更新,可对照参数与基准变化判断其编程与多模态能力定位。
本周新版 Qwen 3.8 27B 与神秘模型 Ox Alpha 相继亮相,前者在 20 个编码提示词上完成本地 LLM 基准测试,后者已在 OpenCode 上线并测试了不同思考等级。
宝玉复盘了自己给字幕转录翻译 App BaoCut 加远程转录功能的完整流程,需求来自一条 GitHub Issue,用户希望把转录任务从办公电脑丢给算力更强的另一台电脑跑。
Addy Osmani 认为软件工厂是围绕软件工作的可重复循环,但可交付的代码仍需人类品味与所有权,人类应前置决定产品意图、系统设计和质量标准。他指出用 Claude Code 或 Codex 配合多会话、带验证的 SPEC 和约束就能走很远,只有当系统需要可重复、事件驱动时才值得建工厂。