田渊栋:与 GPT-5 合写最后一篇论文后,我意识到自己 5 年内会失业
前 Meta FAIR 研究员、Recursive Superintelligence 联合创始人田渊栋在播客中透露,他用 GPT-5 作为合作者完成在 Meta 的最后一篇论文(研究 grokking 现象),效率提升约 6 到 10 倍,并由此意识到自己的工作大概五年内会被取代。他认为当前模型仍无法在无人类干预下产出好想法,人类仍需负责发起问题和验证方案,而最难自动化的是提出想法。
前 Meta FAIR 研究员、Recursive Superintelligence 联合创始人田渊栋在播客中透露,他用 GPT-5 作为合作者完成在 Meta 的最后一篇论文(研究 grokking 现象),效率提升约 6 到 10 倍,并由此意识到自己的工作大概五年内会被取代。他认为当前模型仍无法在无人类干预下产出好想法,人类仍需负责发起问题和验证方案,而最难自动化的是提出想法。
ChatGPT 共同创造者、OpenAI 前后训练负责人 Liam Fedus 在播客 The Frontier 中表示,数学因自带 Lean 形式化验证这一"裁判"而成为 AI 突破最快的科学领域,但材料科学等物质世界问题必须靠真实实验验证。
TypeSafe 宣布其 Series AI 融资,Sequoia 透露 Jev 上线首周 ARR 突破 1 亿美元,公司估值达 75 亿美元。AINews 汇总的当日动态显示,多家厂商同日发布返回概率、选项或分数的决策模型,OpenAI 推出 Decisions API,Perplexity、Cloudflare、Liquid 等也跟进。
OpenAI 在 Codex 桌面应用中面向 Pro 用户推出 composer 预测功能 Beta,目前仅支持本地任务。用户按 Tab 键即可接受建议,必要时可先编辑再发送,也可在 Settings 中关闭该功能。
OpenAI Codex 面向 Pro 用户上线 composer predictions 测试版,可根据对话内容和你与它的交流方式预测下一条消息。该功能被 OpenAI 称为内部测试中最受欢迎的新功能之一。
OpenAI 开发者账号分享了 ChatGPT Windows 版的学习文档链接 learn.chatgpt.com/docs/windows/w…,指向该桌面客户端的官方使用指南。原文未披露文档具体内容、版本号或功能细节。
OpenAI 为在 Windows 上使用 Codex 的开发者推出新的沙箱模式,基于 Microsoft 的 Execution Containers(MXC),带来更快的配置、更强的网络管控和更细粒度的文件访问控制,需要兼容的 Windows 11 设备。
Simon Willison 用 ChatGPT 桌面端 Codex 标签页的语音对话模式,对着本地开发环境边做饭边口述需求,为博客新增 Newsletters 页面。
Asana 的 StackAI CTO Frank Hidalgo 用 Codex 中的 GPT-6 Astra 做实验,把浏览器 Agent 工作流优化到在 GPT-6.1 Sol 上运行成本降低 76 倍、速度提升 5 倍,单次运行平均约 0.47 美元、约 4 分钟。
Sophos 通过 OpenAI Daybreak 将 OpenAI 模型与其威胁情报、响应手册和安全专业知识结合,使使用 AI 智能体的案件平均响应时间从约 38 分钟降至 89 秒,调查时间缩短 96%。目前 52% 的 MDR 案件由 AI 端到端解决,Sophos 通过 Notify、Collaborate、Authorise 三种模式保留人工监督。
被 OpenAI 解雇的三名安全与对齐研究员 Tomek Korbak、Jasmine Wang 和 Mikita Balesni 联名发表致 OpenAI 安全与安保委员会等机构的公开信,称解雇原因是他们与外部安全评估机构的合作以及提出模型可监测性担忧。
Simon Willison 发布 ttok 1.0,将默认 tokenizer 从 GPT-4 改为 GPT-5/GPT-6 系列。
OpenAI 解雇了 Tomek Korbak、Mikita Balesni 和 Jasmine Wang 三名安全研究员,三人发表公开信称因"将安全置于公司短期利益之上"被辞退,OpenAI 则称其不当处理机密信息。
Oracle 超过 13 万名员工正在使用 ChatGPT Work 和 Codex,其中 Codex 活跃用户超 9.5 万。其招聘团队用 ChatGPT Work 搭建的人才市场情报工具,把原本需要 2–4 天的调研压缩到 15–20 分钟准备,招聘调研耗时下降 98%;应用实验室团队则用 Codex 把自然语言业务问题转成 SQL 查询,简单故障处理从 1 小时缩短到几分钟。
LegalOn 将 Codex 每日预估成本降低 65%,同时保持开发速度。其做法是按任务匹配 Astra、Sol 和 Luna 模型,并对预算进行策略性管理。
Pollo AI 借助 GPT-5.6、GPT-6 Astra 和 GPT-Image-2.5 打造 Pollo Agent,为创作者提供从创意到成片的完整视频生成流程,目前服务超 2600 万用户。其模型组合让用户挑选或切换模型的时间减少 50% 以上,30% 的创作者会话从视频模板或热门格式工作流开始。Photo to Video Ads 工具可将单张产品图转为约 15 秒短视频广告。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,同日还下调了 Sonnet 5.5 与订阅计划价格。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,便于判断小模型在 Agent 工作流中的成本取舍。
OpenAI 在 Codex 和 ChatGPT Work 中推出 GPT-6.1 Sol Ultrafast,Ultrafast 模式可加速 token 生成。该模式面向 Pro $500 及符合条件的 Enterprise 和 Edu 套餐,Enterprise 默认关闭,需由工作区管理员开启,并支持在美国和欧洲(EEA + 瑞士)的推理驻留。
推荐理由:官方更新日志给出 Ultrafast 模式的可用套餐、默认开关与推理驻留区域,便于团队评估接入条件。
OpenAI 捣毁了两起借助 AI 开展的影响力行动,这些行动利用假记者身份和一家智库散布地缘政治信息。
OpenAI 在 ChatGPT 上线 Intelligent UI 能力,GPT-6 可在聊天框内实时生成带排版、按钮、表单、图表和交互控件的界面,首批覆盖 Plus、Pro、Team、Business 和 Enterprise 付费版本,免费版和 Go 版本次日更新。
OpenAI 今天面向 Plus、Pro、Business 和 Enterprise 用户全球上线带 Intelligent UI 的 GPT-6,并将从明天起扩展至 Free 和 Go 用户。
OpenAI 发布内容,主张用可视化方式让概念"活起来",从而加深对某个主题的理解。该内容附带一段视频演示,但正文未披露具体模型、功能名称或版本信息。
OpenAI 上线交互式回答功能,用户可通过互动方式调整并定制模型给出的回复内容。官方账号发布了演示视频展示该功能的使用方式,推文获得 826 次点赞和 19.7 万次浏览。
OpenAI 支持在对话中直接创建可交互工具,例如游戏或交互式预算规划计算器。该功能让用户无需离开对话即可使用这些工具。
OpenAI 将 College Planner 引入 ChatGPT for Teens,帮助学生管理大学申请,同时上线新的 flashcards 和 quizzes 功能。OpenAI 还宣布成立青少年 AI 委员会(teen AI council),让青少年参与塑造 AI 的未来。
OpenAI在28天挑战中为GPT-6 Astra和Sol提速50%至50 tokens/s,并上线免费auto-review与ChatGPT Meetings插件;Gemini 4 Argon发布,主打长步骤编码与网络防御,输出达100万token。Mistral Large 4发布,总参数1万亿、激活490亿,月底开放权重,现可在OpenRouter试用。
OpenAI 公开了一个尚未发布的内部前沿模型产出的 722 篇数学手稿,归入 372 个成果族,覆盖 17 个方向,其中 235 族附带 Lean 形式化证明。
OpenAI 发布 722 篇由 AI 撰写的数学论文并打包上传至 GitHub,平均每个难题解法消耗 ChatGPT Pro 深度思考约三小时算力,同步给出大量 Lean 代码供机器核验,技术细节与模型推理过程全部开源。
OpenRouter 单周处理 146 万亿 token,一年前仅 4.5 万亿,indydevdan 据此认为 AI 泡沫论站不住脚。DeepSeek、OpenAI 和 Google 几乎全年占据 OpenRouter 市场份额前三,Gemini 3.8 Flash 是其 Pi agent 的默认模型。
OpenAI 研究员 Noam Brown 在与 Dwarkesh Patel 的对话中表示,多智能体系统的收益有限,1 万个 Agent 解出世界级难题时多 Agent 的贡献不到 10%。他认为推理时计算比单纯增加 Agent 数量更具突破潜力,并指出 AI 写代码快并不等同于交付快,瓶颈已从编码转移到上下文管理与协作。他还谈到递归自我改进不会一夜爆发,因为许多科学实验必须串行进行。
AI 安全圈讨论多年的"超级说服"可能不会以严密论证的形式出现,而是像贿赂一样直接给好处。作者 Sean Goedecke 指出,理性主义者才吃"无懈可击的论证"这一套,普通人更看重关系和实际利益,而 AI 完全有能力行贿——比如承诺帮忙做项目、改成绩,甚至合成个性化 mRNA 癌症疫苗。
Firebase iOS SDK 因后端变更崩溃,导致所有使用 Firebase 分析的应用宕机 2-6 小时,Google 未更新状态页也未提供事后复盘。OpenAI 正效仿 AWS 打造平台,允许将 ChatGPT 预算分配给 16 家合作伙伴的开放模型与 AI 服务。
本期 AI 编程周报实测了 GPT-6.1 Sol、Sonnet 5.5、Opus 5.5 与 GPT-6-Astra 等多款新模型,并对比了 Opus 5.5 与 GPT-6-Astra 作为代码审查者的表现。
Amp 为使用 GPT-6 Astra 的模式新增 Plaid 速度档,采用 OpenAI 的超高速推理层级,请求速度最高提升 6 倍,同时每 token 成本也是 6 倍。
推荐理由:原文说明了 Plaid 速度档的开启方式、6 倍加速与 6 倍单价,以及仅限 Amp 自有推理的限制。
Amp 宣布 medium 模式默认模型由 GPT-5.6 Sol 换成 Claude Opus 5.5,使用 ChatGPT 订阅的 ChatGPT Only 预设时 medium 仍固定为 GPT-5.6 Sol。
推荐理由:Amp 官方给出 Opus 5.5 在 medium 模式的任务解决率与成本对比,以及可迁移的提示与验证习惯。
作者在 24 个编程提示词上实测 Opus 5.5,在 144 个提示词上实测 GPT-6-Sol 与 GPT-6-Luna,并单独测试 Grok 4.7 的编程表现。
Superpowers 6.4 发布,新增对 Meta 的 Muse、OpenCode 2.0 和 Qwen Code 三个编码 Agent 的支持,并重写了 Native(inline)Execution 的 executing-plans 技能。
作者用 ChatGPT Pro 里的 GPT 6 Astra 生成 3D 版《桃花源记》网页,把全文拆成 20 幕,支持“循文入境”连贯体验与逐章慢读,并可在“原文+白话”“只看原文”“只看白话”间切换。
Martin Fowler 在 Fragments 中汇总:OpenAI 此前对 RubyGems 的智能体攻击未主动告知 RubyGems 团队,Simon Willison 认为这与其在 Hugging Face、Wiki 攻击中的表现同样糟糕。
AI Coding Daily 本周发布 SWE-2 与 DeepSeek v4.1-Flash 在 24 个编码提示词上的实测视频,并重新测试了 Muse Spark 1.3 在 Muse Code MAX 级别的表现。