田渊栋:与 GPT-5 合写最后一篇论文后,我意识到自己 5 年内会失业
前 Meta FAIR 研究员、Recursive Superintelligence 联合创始人田渊栋在播客中透露,他用 GPT-5 作为合作者完成在 Meta 的最后一篇论文(研究 grokking 现象),效率提升约 6 到 10 倍,并由此意识到自己的工作大概五年内会被取代。他认为当前模型仍无法在无人类干预下产出好想法,人类仍需负责发起问题和验证方案,而最难自动化的是提出想法。
前 Meta FAIR 研究员、Recursive Superintelligence 联合创始人田渊栋在播客中透露,他用 GPT-5 作为合作者完成在 Meta 的最后一篇论文(研究 grokking 现象),效率提升约 6 到 10 倍,并由此意识到自己的工作大概五年内会被取代。他认为当前模型仍无法在无人类干预下产出好想法,人类仍需负责发起问题和验证方案,而最难自动化的是提出想法。
软件工程正处在人类工程师与 AI 编码系统协作的"半人马时代",这种组合目前比任何一方单独工作都更高效。作者以国际象棋的半人马时代持续约二十年、针织业长达两百年为例,认为软件工程的这一阶段可能还会延续一二十年。当前 Agent 自 2025 年 11 月 Claude Opus 4.5 发布后已可完全无监督运行,但输出仍需人工审查,错误更多属于对齐问题而非普通 bug。
GitHub Next 的 Don Syme 提出在 CI 和 CD 之外增加第三根支柱 Continuous AI,即由仓库事件或定时触发的自动化 AI 工作流,用于持续文档、代码改进、问题分诊和故障分析。
The Pragmatic Engineer 在 LDX3 工程领导力大会的主题演讲给出 2026 年科技行业快照:几乎没人再手写代码,同时运行 5-10 个 Agent 已成常态,IDE 正在淡化。
Martin Fowler 在最新 Fragments 中提出,构建确定性软件与"养育"推理型 LLM 是两回事:前者发现 bug 通常能修复或禁用组件,而 LLM 没有这种简单修复或停用手段。
Prime Radiant 正在开发名为 Sen 的"智能体"同事平台,Sen 拥有持久身份、独立账号和各自的电脑,通过 Slack 与人类同事协作,目前已有开发、运维、项目经理和文档专员四个角色。开发 Sen 的 Ada 主动在 Slack 上催促人类管理者处理积压的 PR 审查,并追问同事 JC 是否是人类。团队最终将 Claude Code 会话升级为 JC Sen。
Cockroach Labs 联合创始人兼 CTO、GIMP 原始作者 Peter Mattis 在 The Pragmatic Engineer 播客中回顾了从开源到 Google 再到创办数据库公司的历程。
作者在 24 个编程提示词上实测 Opus 5.5,在 144 个提示词上实测 GPT-6-Sol 与 GPT-6-Luna,并单独测试 Grok 4.7 的编程表现。
GitHub Next staff research engineer Maggie Appleton 在 Pragmatic Engineer 播客中分享设计工程实践:她用手绘笔记本草图启动项目,因为比向 Claude Code 描述更快,且次日仍可回溯。
针对 Artificial Analysis Index 把十个基准压成一个数字、丢失选型信息的问题,IndyDevDan 提出只用五个基准来排名 GPT-6 Astra。
Armin Ronacher 用 GPT 6 Astra 跑了一个周末的无人值守软件工厂,35 小时产出 75k 行代码、79 个 commit、约 1B tokens(约 1200 美元 API 成本),但没有交付任何有价值的东西。
Addy Osmani 提出"Agentic Skill Decay"概念,指出 AI 智能体虽能跳过大量编码实践,但工程师的品味与判断力仍来自亲手做"reps"。
Addy Osmani 认为软件工厂是围绕软件工作的可重复循环,但可交付的代码仍需人类品味与所有权,人类应前置决定产品意图、系统设计和质量标准。他指出用 Claude Code 或 Codex 配合多会话、带验证的 SPEC 和约束就能走很远,只有当系统需要可重复、事件驱动时才值得建工厂。
Addy Osmani 提出,Agent 每天产生数十万乃至上百万次代码变更,逐行代码审查已不可行,软件质量转而取决于围绕 Agent 设置的约束,即质量门禁。这些门禁包括单元测试、属性测试、验收测试、变异测试,以及圈复杂度和行长等代码质量指标,并贯穿 Agent 从解释器到控制器再到生产的全流程。人类注意力应只投向自动化护栏失效时的复杂问题,否则会拖慢机器速度的流程。
一位开发者分享自己使用 Coding Agent 的角色转变:从紧盯代码层的 TL 转为只做方案与验收的 EM,转折点在 Fable 5 前后,他发现 AI 写的代码质量已相当可以,稍加验证就不会有太大偏离。
针对 @cellier_ 提出的通用 Agent 吃掉垂直 Agent、开放吃掉封闭、下沉吃掉傲慢三个判断,宝玉补充了自己的六点看法:通用 Agent 赛道本身也会是少数赢家通吃,小通用 Agent 同样没有生存空间;开放与封闭的差别不在开源或模型切换,而在插件生态,Skill 加 MCP 是关键。
Addy Osmani 提出软件工厂由循环、Harness、工厂三层构成:循环是单个 Agent 重复执行任务的最小单元,Harness 是沙箱、工具、记忆与完成判定,工厂则是多个 Harness 化循环共用一个审查门。明工厂保留人类判断,暗工厂让 Agent 自行定范围、构建并发布代码,无人阅读细节。他指出图中生成、测试、扫描几乎零成本,唯一难以扩展的是审查门这一"判断"环节。
Addy Osmani 在 AI Engineer World's Fair 2026 闭幕演讲中提出,工程师必须掌控智能体工程的"外循环",即对系统负责。他将智能体定义为模型加 Harness,循环为调查、实现、验证、重复,工厂则是规模化运行的循环。
Steve Yegge 认为技术面试已走到尽头,他基于近 35 年面试官经历指出,Google 的统计显示面试官之间几乎无法达成一致,同一候选人常被一人评为"强烈推荐"、被另一人直接拒绝,且面试分数与入职后表现几乎无关。他曾在 Amazon 担任 Bar Raiser、在 Google 任职 Hiring Committee,认为现有流程靠各种"创可贴"式修补维持,却仍大量误招与错拒。
Steve Yegge 提出"AI 吸血鬼"概念,认为 AI 确实能带来 10 倍生产力,但价值捕获机制决定了开发者要么被公司榨干、要么公司被竞争对手淘汰。他以 Opus 4.5/4.6 配合 Claude Code 为例,称 AI 编程在 2025 年 11 月 24 日到达事件视界,并提到 Claude Code 已在微软工程团队中迅速占据主导。