田渊栋:与 GPT-5 合写最后一篇论文后,我意识到自己 5 年内会失业
前 Meta FAIR 研究员、Recursive Superintelligence 联合创始人田渊栋在播客中透露,他用 GPT-5 作为合作者完成在 Meta 的最后一篇论文(研究 grokking 现象),效率提升约 6 到 10 倍,并由此意识到自己的工作大概五年内会被取代。他认为当前模型仍无法在无人类干预下产出好想法,人类仍需负责发起问题和验证方案,而最难自动化的是提出想法。
前 Meta FAIR 研究员、Recursive Superintelligence 联合创始人田渊栋在播客中透露,他用 GPT-5 作为合作者完成在 Meta 的最后一篇论文(研究 grokking 现象),效率提升约 6 到 10 倍,并由此意识到自己的工作大概五年内会被取代。他认为当前模型仍无法在无人类干预下产出好想法,人类仍需负责发起问题和验证方案,而最难自动化的是提出想法。
ChatGPT 共同创造者、OpenAI 前后训练负责人 Liam Fedus 在播客 The Frontier 中表示,数学因自带 Lean 形式化验证这一"裁判"而成为 AI 突破最快的科学领域,但材料科学等物质世界问题必须靠真实实验验证。
陶哲轩在加州理工学院发表 Math 2.0 演讲,称 AI 正把数学从证明匮乏时代推入证明充沛时代,传统以解题为核心的评价体系已错位。他指出网上 AI 攻破数学难题的捷报属于幸存者偏差,当前数学前沿绝大多数核心问题仍未解决,AI 直接从问题跳到答案会跨过人类理解。Math 2.0 的实践包括用开源 AI 重构四色定理、ABC 猜想等证明,等式理论项目已判定超 2200 万个命题真伪。
ColaOS 创始人橘子复盘个人 Agent 半年变化:云端部署加 flash 级模型(如 DeepSeek Flash、Haiku 5.5)把单用户月成本从几百美元压到约十美元,补贴 token 已低于获客成本,免费打法回归,6 到 18 个月前因成本砸掉的产品值得重做。他放弃卷办公场景,转向「996 之外」的副业与技能变现,今年目标先做到盈亏平衡。
软件工程正处在人类工程师与 AI 编码系统协作的"半人马时代",这种组合目前比任何一方单独工作都更高效。作者以国际象棋的半人马时代持续约二十年、针织业长达两百年为例,认为软件工程的这一阶段可能还会延续一二十年。当前 Agent 自 2025 年 11 月 Claude Opus 4.5 发布后已可完全无监督运行,但输出仍需人工审查,错误更多属于对齐问题而非普通 bug。
密码学家 Matthew Green 称,他认为人类生活在 Minicrypt(公钥加密不可能存在的假想世界)的概率为 1%,而对现有公钥加密算法功能性失去信心的概率为 15%。他指出,AI 制造意外发现的速度与人类更换标准的速度相差数个数量级,只有提前做好准备才能从这类意外中恢复。Minicrypt 出自 Russell Impagliazzo 提出的假想世界。
Liran Tal 在 AI Native DevCon London 的演讲中指出,Agent Skills 不只是给人类看的 markdown,一旦被 Agent 信任就能影响其读取内容、调用工具和访问工作区,因此应被视为供应链组件。
GitHub Next 的 Don Syme 提出在 CI 和 CD 之外增加第三根支柱 Continuous AI,即由仓库事件或定时触发的自动化 AI 工作流,用于持续文档、代码改进、问题分诊和故障分析。
Ramp 和 Stripe 为不会写代码的员工搭建了内部平台,让他们用 Vibe Coding 自行构建内部网站和工具,这些平台在两家公司内部正快速普及。The Pragmatic Engineer 的 The Pulse 专栏将这一现象称为中型科技公司的新趋势,并预计会有更多公司跟进。
Periodic Labs 的 Liam Fedus 与 Ekin Dogus Cubuk 在播客中提出“合成超级智能”,主张 AI 科学发现应靠扎根物理实验的强化学习,而非只训练更多互联网数据。他们讨论材料发现闭环中的预测、合成与表征,DFT 与仿真,以及让每台实验仪器具备“140 IQ”的高通量自主实验室。两人认为失败实验可能是最有价值的训练数据,自主实验有望把数十年的试错压缩到数月。
《Building Microservices》作者 Sam Newman 在新书《Building Resilient Distributed Systems》中提出分布式系统三法则:信息传输需要时间、资源可能离线、资源并非无限,并指出多数故障源于资源耗尽。
The Pragmatic Engineer 在 LDX3 工程领导力大会的主题演讲给出 2026 年科技行业快照:几乎没人再手写代码,同时运行 5-10 个 Agent 已成常态,IDE 正在淡化。
OpenRouter 单周处理 146 万亿 token,一年前仅 4.5 万亿,indydevdan 据此认为 AI 泡沫论站不住脚。DeepSeek、OpenAI 和 Google 几乎全年占据 OpenRouter 市场份额前三,Gemini 3.8 Flash 是其 Pi agent 的默认模型。
Martin Fowler 在最新 Fragments 中提出,构建确定性软件与"养育"推理型 LLM 是两回事:前者发现 bug 通常能修复或禁用组件,而 LLM 没有这种简单修复或停用手段。
OpenAI 研究员 Noam Brown 在与 Dwarkesh Patel 的对话中表示,多智能体系统的收益有限,1 万个 Agent 解出世界级难题时多 Agent 的贡献不到 10%。他认为推理时计算比单纯增加 Agent 数量更具突破潜力,并指出 AI 写代码快并不等同于交付快,瓶颈已从编码转移到上下文管理与协作。他还谈到递归自我改进不会一夜爆发,因为许多科学实验必须串行进行。
工程师的会议、设计文档、项目管理等能力都建立在"能交付"这一基础之上,就像 Dota 2 的对线或万智牌、星际争霸中的快攻策略一样,它约束了整个策略空间。作者认为 AI 并未改变这一点:交付从来不只是写代码,还涉及找到最务实的路径、解决沿途问题并让管理者知情,LLM 无法端到端完成,因为需要太多关于公司技术系统、相关人员及其动机的上下文。
AI 安全圈讨论多年的"超级说服"可能不会以严密论证的形式出现,而是像贿赂一样直接给好处。作者 Sean Goedecke 指出,理性主义者才吃"无懈可击的论证"这一套,普通人更看重关系和实际利益,而 AI 完全有能力行贿——比如承诺帮忙做项目、改成绩,甚至合成个性化 mRNA 癌症疫苗。
Prime Radiant 正在开发名为 Sen 的"智能体"同事平台,Sen 拥有持久身份、独立账号和各自的电脑,通过 Slack 与人类同事协作,目前已有开发、运维、项目经理和文档专员四个角色。开发 Sen 的 Ada 主动在 Slack 上催促人类管理者处理积压的 PR 审查,并追问同事 JC 是否是人类。团队最终将 Claude Code 会话升级为 JC Sen。
Cockroach Labs 联合创始人兼 CTO、GIMP 原始作者 Peter Mattis 在 The Pragmatic Engineer 播客中回顾了从开源到 Google 再到创办数据库公司的历程。
Martin Fowler 在 Fragments 中引用 Simon Willison 的观点:编码 Agent 虽能做出惊人成果,却让软件工程变得"更难",发挥其全部潜力需要极高的纪律与知识。
针对“软件工程正进入人机半人马时代”的观点,Sean Goedecke 认为 AI 辅助的工程师虽然比 AI 和人类单独都强,但并非在编程本身上更强。AI 写的代码能编译、少有并发错误,问题在于不可维护、为满足虚构需求牺牲重要需求等“品味”问题,因此人类的核心价值是让 AI 对齐组织价值观。前沿模型对工作程序员存在错位,如堆砌大段注释和无用单元测试,而对齐比能力更难解决且更依赖上下文。
资深工程师 Sean Goedecke 给初级软件工程师的建议是:不要轻信 ZIRP 时代形成的职业建议,不要参与政治斗争,保持友好与尽责,并主动理解自己负责的系统。面对 AI,他认为不应回避,因为公司会像要求建筑工人使用电动工具一样要求工程师使用 AI,但绝不能把判断权交给 AI,不要把 AI 的输出原样转给同事,沦为“肉代理(meat proxy)”。
Rails 创始人 David Heinemeier Hansson(DHH)在 Rails World 主题演讲中宣布,至少在 37signals,专业工作已不再需要手写代码,由此引发新一轮“手写代码之死”争论。本期 The Pulse 还关注 Amazon 与 Meta 在招聘方面遇到的困难。
Martin Fowler 在 9 月 24 日的碎片集中回应 Rob Bowley 的观点:真正该担心的不是未来 AI 灭绝人类,而是当下 AI 被轻率快速地接入一切,智能体部署中常出现 Lethal Trifecta 安全漏洞。
作者在 24 个编程提示词上实测 Opus 5.5,在 144 个提示词上实测 GPT-6-Sol 与 GPT-6-Luna,并单独测试 Grok 4.7 的编程表现。
GitHub Next staff research engineer Maggie Appleton 在 Pragmatic Engineer 播客中分享设计工程实践:她用手绘笔记本草图启动项目,因为比向 Claude Code 描述更快,且次日仍可回溯。
GitHub Podcast 最新一期拆解了五个 AI 热门论断:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决的是不同问题,前者是可读的打包经验,后者是连接工具与数据的标准接口,二者可组合使用。
Martin Fowler 撰文表示,尽管他认可 LLM 能带来生产力提升、且"不使用反而不负责任",但他对与 LLM 直接交互本身抱有强烈的反感:它们用令人不适的"LLM 腔"说话,自信地胡说八道,被指出错误时也只表现出虚假的歉意。他认为 LLM 是硅谷 brogrammer 亚文化的产物,被创造者的价值观所塑造,因此不应把 AI 智能体拟人化。
针对 Artificial Analysis Index 把十个基准压成一个数字、丢失选型信息的问题,IndyDevDan 提出只用五个基准来排名 GPT-6 Astra。
Armin Ronacher 用 Opus 5 按 David Sacks 推文的结构生成了一段 8 段、350 词以内的文本,Pangram 判定其为 100% AI 生成。随后他逐段人工改写,与原文相似度约 50%、无一句相同,仅用 LLM 修正错别字。Pangram 自称误判人类文本为 AI 的比例为 0.0041%,漏检 AI 文本为 0.34%。
Armin Ronacher 撰文回应 Dario Amodei 提出的"前沿调速"主张,认为真正值得担心的不是 AI 造核弹,而是它对普通人的影响。他指出当前只有 Anthropic 和 OpenAI 两家公司在这一领域举足轻重,二者同源且都受益于公共数据训练,而 Dario 提议的第三方评估机构 METR 也与两家关系密切。
Armin Ronacher 用 GPT 6 Astra 跑了一个周末的无人值守软件工厂,35 小时产出 75k 行代码、79 个 commit、约 1B tokens(约 1200 美元 API 成本),但没有交付任何有价值的东西。
Armin Ronacher 想给廉价 CarPlay 车机棒刷第三方固件,通过 Pi 与 LLM 对话得知了用 Rust 重写 CarPlay 协议的 CatPlay,并让 Kimi K3 和 Sol 帮忙搞定刷机与为对应 SoC 编译。
Zed 认为 Ted Nelson 的 Xanadu 超文本构想之所以长期无法落地,是因为缺少能耐心追踪每一层引用的用户,而 AI 智能体正好补上这一环。DeltaDB 用 Lamport 时间戳、Merkle 树、CRDT、廉价存储、常连网络和 Firecracker 级微虚拟机等六十年积累的组件,实现"永不复制、只引用,永不覆盖、只版本化"的 xanalogical 计算。
IndyDevDan 提出 Agentic Engineering Operating Level 框架,把工程师和 Agent 可操作的层级分为五级:Code Primitives、Code Structure、Data and Execution、Delivery and Intent、Agentic Systems。
Addy Osmani 提出"Agentic Skill Decay"概念,指出 AI 智能体虽能跳过大量编码实践,但工程师的品味与判断力仍来自亲手做"reps"。
Steve Yegge 每月花费约 12.2 万美元 API token(约每天 4000 美元),使用 21 个 Claude Max 账号,并以每周 2 个的速度增长,用于开发他做了 30 年的游戏 Wyvern。
Armin Ronacher 撰文回应"在当下科技行业怎么可能不愤怒"的提问,认为面对 AI 更合理的情绪是迷茫与焦虑而非愤怒,因为愤怒需要一个可归咎的对象,而 AI 带来的冲击让每个人都难以看清未来。他建议用不确定感取代愤怒,因为它能通向好奇心,进而带来实验与行动的自由;许多公开表现自信的从业者私下同样充满不确定,只是在用信心为自己争取筹码。
Armin Ronacher 认为 LLM 让语言选择变得不再重要,开发者可以重写语言或选用自己完全不熟悉的语言,因此更倾向按语言营销来选型,Rust 因此迎来一批此前不会选它的开发者。
Addy Osmani 认为软件工厂是围绕软件工作的可重复循环,但可交付的代码仍需人类品味与所有权,人类应前置决定产品意图、系统设计和质量标准。他指出用 Claude Code 或 Codex 配合多会话、带验证的 SPEC 和约束就能走很远,只有当系统需要可重复、事件驱动时才值得建工厂。