田渊栋:与 GPT-5 合写最后一篇论文后,我意识到自己 5 年内会失业
前 Meta FAIR 研究员、Recursive Superintelligence 联合创始人田渊栋在播客中透露,他用 GPT-5 作为合作者完成在 Meta 的最后一篇论文(研究 grokking 现象),效率提升约 6 到 10 倍,并由此意识到自己的工作大概五年内会被取代。他认为当前模型仍无法在无人类干预下产出好想法,人类仍需负责发起问题和验证方案,而最难自动化的是提出想法。
前 Meta FAIR 研究员、Recursive Superintelligence 联合创始人田渊栋在播客中透露,他用 GPT-5 作为合作者完成在 Meta 的最后一篇论文(研究 grokking 现象),效率提升约 6 到 10 倍,并由此意识到自己的工作大概五年内会被取代。他认为当前模型仍无法在无人类干预下产出好想法,人类仍需负责发起问题和验证方案,而最难自动化的是提出想法。
OpenCode 发布 v1.19.0,用户可通过 `opencode upgrade --major` 升级到 OpenCode 2。TUI 新增 /update 命令用于安装更新或升级到 OpenCode 2,更新不再自动安装。此版本还允许使用 OpenAI ultrafast 服务层级,并在检查 PTY 是否存在前校验 PTY 连接来源与 ticket。
Anthropic 发布 Claude Motion 完整上手指南,动效视频不再依赖视频大模型,而是由 Opus 5.5 在 Claude Code 中调用 HyperFrames 框架编写动效代码并直接渲染导出 MP4。
TypeSafe 宣布其 Series AI 融资,Sequoia 透露 Jev 上线首周 ARR 突破 1 亿美元,公司估值达 75 亿美元。AINews 汇总的当日动态显示,多家厂商同日发布返回概率、选项或分数的决策模型,OpenAI 推出 Decisions API,Perplexity、Cloudflare、Liquid 等也跟进。
软件工程正处在人类工程师与 AI 编码系统协作的"半人马时代",这种组合目前比任何一方单独工作都更高效。作者以国际象棋的半人马时代持续约二十年、针织业长达两百年为例,认为软件工程的这一阶段可能还会延续一二十年。当前 Agent 自 2025 年 11 月 Claude Opus 4.5 发布后已可完全无监督运行,但输出仍需人工审查,错误更多属于对齐问题而非普通 bug。
Amp 现在支持使用 Claude Pro/Max 订阅,功能免费并向所有人开放。新建 thread 时选择 Mode > Claude Code 即可,未关联订阅会提示先关联;该模式底层改用 Claude Agent SDK 而非 Amp 自有 Agent,同时保留了 orbs 与 runners、thread 分享、portals、多人协作、thread 间消息与编排等能力。
推荐理由:原文说明了 Amp 接入 Claude 订阅的具体入口与底层实现,读者可据此判断订阅复用对现有工作流的影响。
GitHub Copilot 本周更新中,Claude Haiku 5.5 已向 Copilot Pro、Pro+、Max、Business 和 Enterprise 用户开放。
推荐理由:汇总了 Copilot 本周在账号分离、本地沙箱和本地模型接入上的多项更新,可据此判断现有工作流的调整空间。
Claude Code 2.1.296 为 Claude apps gateway 的 managed.policies[] 新增 code 键,与 cli 配置相同并应用于 Claude Desktop 的 Code 标签页,同时开启 Desktop 的 gateway 模式。
OpenAI 在 Codex 桌面应用中面向 Pro 用户推出 composer 预测功能 Beta,目前仅支持本地任务。用户按 Tab 键即可接受建议,必要时可先编辑再发送,也可在 Settings 中关闭该功能。
OpenAI Codex 面向 Pro 用户上线 composer predictions 测试版,可根据对话内容和你与它的交流方式预测下一条消息。该功能被 OpenAI 称为内部测试中最受欢迎的新功能之一。
OpenAI 为在 Windows 上使用 Codex 的开发者推出新的沙箱模式,基于 Microsoft 的 Execution Containers(MXC),带来更快的配置、更强的网络管控和更细粒度的文件访问控制,需要兼容的 Windows 11 设备。
GitHub 将 GitHub Copilot CLI、Copilot 应用和 Copilot SDK 背后的运行时从 TypeScript 和 Node.js 迁移到 Rust,通过 AI 辅助重写替换了超过 80 万行生产代码。
Simon Willison 用 ChatGPT 桌面端 Codex 标签页的语音对话模式,对着本地开发环境边做饭边口述需求,为博客新增 Newsletters 页面。
Superpowers 在首次公开发布一周年之际推出 7.0,最大变化是完全重建的头脑风暴体验,更擅长帮用户理清和表达想做的产品,也更愿意在用户目标明确时让编码 Agent 直接干活。
OpenHands 发布 v1.26.0,新增 verify-openhands 技能及配套 control-openhands CLI 与完整功能图谱,并支持每日验证。该版本还加入后端认证视图辅助、企业后端 Super Admin 设置引导,以及大量可访问性与错误提示修复。
opencode 发布 v2.0.26。该版本于 10 月 8 日打上标签,发布页仅提供 2 个资源文件,未附具体更新说明。
Tessl 在 AI Native DevCon London 提出,AI 编码 Agent 让 PR 变多却卡在代码审查,根因是缺乏验证层。其方案是把规格转成可执行检查:一个 Agent 做规划拆解需求与边界情况,多个验证 Agent 并行逐条核对预览环境,再由编排器汇总报告。审查需同时基于规格与代码,并优先对照 base branch 而非仅看 diff。
GitHub Next 的 Don Syme 提出在 CI 和 CD 之外增加第三根支柱 Continuous AI,即由仓库事件或定时触发的自动化 AI 工作流,用于持续文档、代码改进、问题分诊和故障分析。
Oracle 超过 13 万名员工正在使用 ChatGPT Work 和 Codex,其中 Codex 活跃用户超 9.5 万。其招聘团队用 ChatGPT Work 搭建的人才市场情报工具,把原本需要 2–4 天的调研压缩到 15–20 分钟准备,招聘调研耗时下降 98%;应用实验室团队则用 Codex 把自然语言业务问题转成 SQL 查询,简单故障处理从 1 小时缩短到几分钟。
LegalOn 将 Codex 每日预估成本降低 65%,同时保持开发速度。其做法是按任务匹配 Astra、Sol 和 Luna 模型,并对预算进行策略性管理。
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的下一版本,架构未变,仍为 2.5B 激活参数、Apache 2.0 许可。
推荐理由:JetBrains 开源 12B MoE 编码模型,读者可了解其强化学习后训练路线与本地部署的取舍。
opencode 发布 v2.0.25。该版本于 10 月 8 日打上标签,发布资源共 2 项。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,同日还下调了 Sonnet 5.5 与订阅计划价格。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,便于判断小模型在 Agent 工作流中的成本取舍。
OpenAI 在 Codex 和 ChatGPT Work 中推出 GPT-6.1 Sol Ultrafast,Ultrafast 模式可加速 token 生成。该模式面向 Pro $500 及符合条件的 Enterprise 和 Edu 套餐,Enterprise 默认关闭,需由工作区管理员开启,并支持在美国和欧洲(EEA + 瑞士)的推理驻留。
推荐理由:官方更新日志给出 Ultrafast 模式的可用套餐、默认开关与推理驻留区域,便于团队评估接入条件。
Anthropic 最新的轻量模型 Claude Haiku 5.5 已在 GitHub Copilot 正式可用,面向 Copilot Pro、Pro+、Max。
推荐理由:官方说明 Haiku 5.5 在 Copilot 中的可用范围与计费方式,便于团队评估是否切换轻量模型。
Coleman Parkes 代表 Undo 对 300 位负责关键任务软件的资深工程负责人调研发现,AI 编码 Agent 虽加快了代码生成,却把主要瓶颈转移到调试、代码理解和维护。
GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用代码上下文识别数据库密码等非结构化密钥,候选批次评估耗时低于 2 毫秒,可将可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 用九个季度的数据说明密钥泄露与代码量同步增长,并给出把检测前移到 push 环节的模型方案。
GitHub 发布用于密钥检测的微调模型,可读取上下文代码识别无固定格式的密码等凭据,且不生成代码或文本。已有 AI 检测密码告警的客户自动升级到新模型,AI 检测密钥的推送保护进入 private preview,Copilot CLI 和 Copilot App 的 /security-review 命令中的 AI 密钥扫描也将很快进入 private preview。
推荐理由:GitHub 把微调后的密钥检测模型接入推送保护与 Copilot 安全审查,读者可据此判断其计费与启用方式。
GitHub Copilot 的本地沙箱功能正式可用,覆盖 Copilot CLI、Copilot 应用和使用 Agent Host 的 VS Code 会话。
推荐理由:官方说明了本地沙箱在三个入口的正式可用状态与策略边界,可据此判断智能体工作流的权限控制方式。
Latent Space 采访了 Kubernetes 联合创造者 Craig McLuckie 和 Joe Beda,他们创办的 Stacklok 正把编码 Agent 从桌面搬到云端。
InfoQ 将于 10 月 14 日举办免费 60 分钟线上研讨会“AI in Production: What Breaks, What Works, and Who Approves It?
我实测了 Claude、Codex、Cursor 的 $20/月套餐限额,用 10 个编码提示词对比了各家的额度消耗。Matt Pocock Skills v1.3 新增 /retro,可在当前会话结束后改进 Agent 未来会话的表现,我已在真实项目上做了前后对比测试。
Gemini CLI 发布 v0.63.0,修复连接恢复时显示重试进度指示器、区分 MCP 启用配置缺失与 JSON 格式错误、恢复能力检测后暂停的 stdin 等问题。核心侧限制工具输出大小并优化长时间运行 Agent 循环的内存生命周期,同时在非交互模式下启用自主计划执行。
The Pragmatic Engineer 在 LDX3 工程领导力大会的主题演讲给出 2026 年科技行业快照:几乎没人再手写代码,同时运行 5-10 个 Agent 已成常态,IDE 正在淡化。
Mistral 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、520 亿激活参数的原生多模态模型,权重将于本月底开放。
推荐理由:Mistral 官方给出 ML4 的完整能力清单与开源权重时间表,可据此判断欧洲开源模型在编码与智能体任务上的位置。
OpenHands 发布 v1.25.0,新增 Model Router 直连提示词设置、会话开始时运行开关,以及按连接批量添加 LLM profiles。Canvas Apps 支持 Update 操作,聊天输入框加入可选语音听写,Agent profiles 可自定义 persona 或额外指令并固定 SDK 1.53.0。
Cursor 上线 Remote Control,可在 Cursor iOS app 中查看并回复运行在本地电脑上的 Agent。
推荐理由:官方说明了本地 Agent 远程查看与回复的开启方式和运行前提,便于判断是否适合远程办公场景。
Amp 的 Puck 现已支持开启多个独立会话,每个会话拥有各自的 Puck,点 + 即可新建,点击顶部会话名可切换。三天未使用的会话会被移入 Inactive,以保持列表简洁。
千问 Qwen Code 发布 v0.25.0,新增本地 workspace-agent 协作、workspace agent 的 A2A 访问与共享,并将 Mem0 打包进主 CLI。该版本还引入 managed-agent 的私有 Hosted MCP 运行时、托管文件历史与撤销、持久化 Hosted Hooks,以及 IMAP/SMTP 邮件渠道。无已知破坏性变更。
Martin Fowler 在最新 Fragments 中提出,构建确定性软件与"养育"推理型 LLM 是两回事:前者发现 bug 通常能修复或禁用组件,而 LLM 没有这种简单修复或停用手段。