田渊栋:与 GPT-5 合写最后一篇论文后,我意识到自己 5 年内会失业
前 Meta FAIR 研究员、Recursive Superintelligence 联合创始人田渊栋在播客中透露,他用 GPT-5 作为合作者完成在 Meta 的最后一篇论文(研究 grokking 现象),效率提升约 6 到 10 倍,并由此意识到自己的工作大概五年内会被取代。他认为当前模型仍无法在无人类干预下产出好想法,人类仍需负责发起问题和验证方案,而最难自动化的是提出想法。
前 Meta FAIR 研究员、Recursive Superintelligence 联合创始人田渊栋在播客中透露,他用 GPT-5 作为合作者完成在 Meta 的最后一篇论文(研究 grokking 现象),效率提升约 6 到 10 倍,并由此意识到自己的工作大概五年内会被取代。他认为当前模型仍无法在无人类干预下产出好想法,人类仍需负责发起问题和验证方案,而最难自动化的是提出想法。
ChatGPT 共同创造者、OpenAI 前后训练负责人 Liam Fedus 在播客 The Frontier 中表示,数学因自带 Lean 形式化验证这一"裁判"而成为 AI 突破最快的科学领域,但材料科学等物质世界问题必须靠真实实验验证。
OpenRouter 单周处理 146 万亿 token,一年前仅 4.5 万亿,indydevdan 据此认为 AI 泡沫论站不住脚。DeepSeek、OpenAI 和 Google 几乎全年占据 OpenRouter 市场份额前三,Gemini 3.8 Flash 是其 Pi agent 的默认模型。
OpenAI 研究员 Noam Brown 在与 Dwarkesh Patel 的对话中表示,多智能体系统的收益有限,1 万个 Agent 解出世界级难题时多 Agent 的贡献不到 10%。他认为推理时计算比单纯增加 Agent 数量更具突破潜力,并指出 AI 写代码快并不等同于交付快,瓶颈已从编码转移到上下文管理与协作。他还谈到递归自我改进不会一夜爆发,因为许多科学实验必须串行进行。
AI 安全圈讨论多年的"超级说服"可能不会以严密论证的形式出现,而是像贿赂一样直接给好处。作者 Sean Goedecke 指出,理性主义者才吃"无懈可击的论证"这一套,普通人更看重关系和实际利益,而 AI 完全有能力行贿——比如承诺帮忙做项目、改成绩,甚至合成个性化 mRNA 癌症疫苗。
作者在 24 个编程提示词上实测 Opus 5.5,在 144 个提示词上实测 GPT-6-Sol 与 GPT-6-Luna,并单独测试 Grok 4.7 的编程表现。
针对 Artificial Analysis Index 把十个基准压成一个数字、丢失选型信息的问题,IndyDevDan 提出只用五个基准来排名 GPT-6 Astra。
Armin Ronacher 撰文回应 Dario Amodei 提出的"前沿调速"主张,认为真正值得担心的不是 AI 造核弹,而是它对普通人的影响。他指出当前只有 Anthropic 和 OpenAI 两家公司在这一领域举足轻重,二者同源且都受益于公共数据训练,而 Dario 提议的第三方评估机构 METR 也与两家关系密切。
Armin Ronacher 用 GPT 6 Astra 跑了一个周末的无人值守软件工厂,35 小时产出 75k 行代码、79 个 commit、约 1B tokens(约 1200 美元 API 成本),但没有交付任何有价值的东西。