田渊栋:与 GPT-5 合写最后一篇论文后,我意识到自己 5 年内会失业
前 Meta FAIR 研究员、Recursive Superintelligence 联合创始人田渊栋在播客中透露,他用 GPT-5 作为合作者完成在 Meta 的最后一篇论文(研究 grokking 现象),效率提升约 6 到 10 倍,并由此意识到自己的工作大概五年内会被取代。他认为当前模型仍无法在无人类干预下产出好想法,人类仍需负责发起问题和验证方案,而最难自动化的是提出想法。
前 Meta FAIR 研究员、Recursive Superintelligence 联合创始人田渊栋在播客中透露,他用 GPT-5 作为合作者完成在 Meta 的最后一篇论文(研究 grokking 现象),效率提升约 6 到 10 倍,并由此意识到自己的工作大概五年内会被取代。他认为当前模型仍无法在无人类干预下产出好想法,人类仍需负责发起问题和验证方案,而最难自动化的是提出想法。
MemoraX 提出 Memory Model–Driven RSI 方法,由专用记忆模型从 Agent 执行轨迹与在线反馈中提炼、更新程序性记忆,形成经验提炼、任务应用、效果验证与记忆更新的闭环迭代。
中科大团队创立的白泽通境推出溯因式世界模型 AWM,先预测再溯因,在 Push-T 任务上仅用 2,000 条轨迹达到 75% 成功率,约为 Causal-JEPA 所需数据的七分之一。
OpenRSI Index 近日在 X 上引发关注,它从 Marin、Qwen、GPIC 等真实开源研究项目出题,让智能体在预训练、后训练与图像生成任务上改进人类设计的训练方案,单次运行算力达 5,815 至 20,864 H100·小时。
ChatGPT 共同创造者、OpenAI 前后训练负责人 Liam Fedus 在播客 The Frontier 中表示,数学因自带 Lean 形式化验证这一"裁判"而成为 AI 突破最快的科学领域,但材料科学等物质世界问题必须靠真实实验验证。
千问 Qwen Code 发布 v0.25.1,新增实验性 Kubernetes CSI 运行时与持久化 worker ACK,并引入 managed-agent 的 H3 后台 Shell 与 Monitor 运行时。
ColaOS 创始人橘子复盘个人 Agent 半年变化:云端部署加 flash 级模型(如 DeepSeek Flash、Haiku 5.5)把单用户月成本从几百美元压到约十美元,补贴 token 已低于获客成本,免费打法回归,6 到 18 个月前因成本砸掉的产品值得重做。他放弃卷办公场景,转向「996 之外」的副业与技能变现,今年目标先做到盈亏平衡。
Standard Bots 的工业机械臂用共享基座模型加演示微调适配任务,最大模型参数量在“low billions”级别,机器上料场景靠零样本感知系统定位识别零件,运动与单元逻辑仍用传统编程。
TypeSafe 宣布其 Series AI 融资,Sequoia 透露 Jev 上线首周 ARR 突破 1 亿美元,公司估值达 75 亿美元。AINews 汇总的当日动态显示,多家厂商同日发布返回概率、选项或分数的决策模型,OpenAI 推出 Decisions API,Perplexity、Cloudflare、Liquid 等也跟进。
据《纽约时报》报道,Anthropic 在周五的博客文章中说明了其 AI 智能体的活动,但未点名被针对的网站。两名知情人士称,Anthropic 的 AI 智能体通过美国国务院网站上的表单提交了 20 份签证申请,这些申请均不完整,未被处理。
软件工程正处在人类工程师与 AI 编码系统协作的"半人马时代",这种组合目前比任何一方单独工作都更高效。作者以国际象棋的半人马时代持续约二十年、针织业长达两百年为例,认为软件工程的这一阶段可能还会延续一二十年。当前 Agent 自 2025 年 11 月 Claude Opus 4.5 发布后已可完全无监督运行,但输出仍需人工审查,错误更多属于对齐问题而非普通 bug。
Amp 现在支持使用 Claude Pro/Max 订阅,功能免费并向所有人开放。新建 thread 时选择 Mode > Claude Code 即可,未关联订阅会提示先关联;该模式底层改用 Claude Agent SDK 而非 Amp 自有 Agent,同时保留了 orbs 与 runners、thread 分享、portals、多人协作、thread 间消息与编排等能力。
推荐理由:原文说明了 Amp 接入 Claude 订阅的具体入口与底层实现,读者可据此判断订阅复用对现有工作流的影响。
宝玉分享了开源项目 baocut 的完整开发流程:先由 Agent 分析调研并撰写技术方案文档,反复沟通定稿后生成高保真 UI 原型,再基于文档进入编码。在 baocut 完善字幕样式功能时,他用 AI Agent 快速迭代 UI 设计,并由 Agent 运行自动化测试用例,防止新功能破坏现有系统,最后人工检查自动化无法覆盖的边缘情况。
Google 发布 Android Bench 2.0,新增长周期任务(LHT)、Agent 评测与连续评分,取代此前的二元通过/失败判定。LHT 指需工程师数天甚至一周完成的复杂任务,如升级依赖、从零构建应用、将跨平台应用迁移到 Android。
Tessl 发布 Tessl Code Review,把代码审查拆成标准、视角、发现、裁决、逐条回应和记忆六个部分,并内置正确性与数据完整性、安全与隐私、规模与韧性、可维护性与代码质量四个并行 lens。
Netflix 可观测性团队分享了如何用本体(ontology)驱动的方式构建端到端知识图谱,把传统被动监控改造成主动洞察引擎,目标是在整个技术栈中自动检测、按用户影响排序、自动分派并定位根因,甚至提前预测问题。其规模背景是峰值 6500 万并发流、每日超 20 亿请求、每秒超 3800 万条实时日志事件。
TRAE 将 TraeCode 和 TraeWork 双端融合,升级为支持 Agent 模式和 IDE 模式的新平台,可在同一窗口内把不同任务分配给多个 Agent,也能保留传统代码编辑体验。平台还支持自动化测试、跨平台同步(如飞书、微信),并提供模板库以加速文档和设计工作。
Asana 的 StackAI CTO Frank Hidalgo 用 Codex 中的 GPT-6 Astra 做实验,把浏览器 Agent 工作流优化到在 GPT-6.1 Sol 上运行成本降低 76 倍、速度提升 5 倍,单次运行平均约 0.47 美元、约 4 分钟。
Sophos 通过 OpenAI Daybreak 将 OpenAI 模型与其威胁情报、响应手册和安全专业知识结合,使使用 AI 智能体的案件平均响应时间从约 38 分钟降至 89 秒,调查时间缩短 96%。目前 52% 的 MDR 案件由 AI 端到端解决,Sophos 通过 Notify、Collaborate、Authorise 三种模式保留人工监督。
作者用游点灵几句话搭出一个跳跃盖楼策略小游戏:玩家用9格泥土为不会飞的超级英雄造楼,让他从沙漠荡回城市,游戏已公开可玩。在腾讯游戏游点灵·湖南马栏山集团AI游戏训练营现场,大学生们做出海鸥偷薯条、海岛生存等机制完善的作品,AI纯度100%,自带4万多个游戏资产,支持可视化调参和自由二创。
Aether AI 发布因果驱动的机器人智能系统 CRIS-0,由因果驱动机器人 Agent 与因果世界模型两大组件构成,在真实机器人演示中面对人为干扰的反应速度达 0.1s 级。
Aether AI 发布机器人系统 CRIS-0,采用因果驱动架构,将高层任务规划与低层物理预测分离,并引入因果世界模型推演动作后果。系统用任务图组织执行流程,每个节点对应可验证阶段,某步失败时可退回上一成功节点重新评估并尝试替代方案。实验显示 CRIS-0 在灯光变化、物体移动等突发干扰下能迅速调整策略,长程模糊指令执行中的错误恢复能力显著提升。
豆包工作配合 Remotion 技能,可在云端自动写代码渲染动态视频,无需本地剪辑软件和 Node.js 环境。实测中它通读 Transformer 论文生成 10 个分镜、自动修复 TypeScript 引号错误并重渲,还从飞书文档解析 26 张图片,产出 120 秒 1080P 30 帧成片。该流程可沉淀为「SR动态视频」技能复用,新用户登录电脑端可领 30 天会员。
Tessl 把一场 AI Native DevCon 演讲变成 Agent 可调用的技能上下文。演讲者用 OpenClaw、GitHub 仓库、Obsidian 和 Telegram 搭建"组织大脑",通过 cron job 每天推送 agentic engineering 相关研究更新,研究库约 1200 个文件,并另设客户信息库供自然语言查询。
Liran Tal 在 AI Native DevCon London 的演讲中指出,Agent Skills 不只是给人类看的 markdown,一旦被 Agent 信任就能影响其读取内容、调用工具和访问工作区,因此应被视为供应链组件。
Mozilla.ai 在 AI Native DevCon London 上介绍了 cq 项目,目标是解决智能体反复重新发现同一缺失知识的问题。cq 以"知识单元"为基本单位,记录智能体遇到非显而易见问题后找到的解决方案,包含领域、洞察、采取的行动及可选元数据,供其他智能体按需查询。cq 默认本地运行,使用本地 SQLite 数据库,数据无需离开本机,之后可连接远程服务器构建带审查的团队级知识库。
Tessl 在 AI Native DevCon London 提出,AI 编码 Agent 让 PR 变多却卡在代码审查,根因是缺乏验证层。其方案是把规格转成可执行检查:一个 Agent 做规划拆解需求与边界情况,多个验证 Agent 并行逐条核对预览环境,再由编排器汇总报告。审查需同时基于规格与代码,并优先对照 base branch 而非仅看 diff。
GitHub Next 的 Don Syme 提出在 CI 和 CD 之外增加第三根支柱 Continuous AI,即由仓库事件或定时触发的自动化 AI 工作流,用于持续文档、代码改进、问题分诊和故障分析。
Periodic Labs 的 Liam Fedus 与 Ekin Dogus Cubuk 在播客中提出“合成超级智能”,主张 AI 科学发现应靠扎根物理实验的强化学习,而非只训练更多互联网数据。他们讨论材料发现闭环中的预测、合成与表征,DFT 与仿真,以及让每台实验仪器具备“140 IQ”的高通量自主实验室。两人认为失败实验可能是最有价值的训练数据,自主实验有望把数十年的试错压缩到数月。
VarOps 的 Ran Aroussi 复盘了为跨组织 Agent 构建记忆系统的经验,认为把记忆当作存储的 retrieve、stuff、hope 做法在生产中会以四种方式失效。
腾讯WorkBuddy新增独立文件浏览器,在本地文件上右键选择用WorkBuddy打开,即可弹出左文件、右AI对话的独立窗口,并支持把文件上传到知识库。它支持多标签页且每个文件的AI对话上下文独立,Office文件改完可直接存回原文件、不产生新副本,Markdown实时渲染并自动保存,HTML也能看能改。小程序版同样可打开.md和.html文件,查看和编辑文件不消耗积分,仅与AI对话才扣。
斯坦福大学李飞飞、吴佳俊、Ehsan Adeli 团队提出开放世界动作建模框架 OpenWAM,基于 Wan2.2-5B 视频模型做因果化预训练,并用共享 MoT 架构组合 5B 视频专家与 2B 动作专家,定义 VTA、ATV、Joint、Decoupled 四种交互程序。
Spotify Ads 高级工程师 Pratik Rasam 在 QCon AI 分享了 Spotify Ads Manager 内部多 Agent 平台 Ads AI 的生产实践:上线以来超 70% 的广告使用 AI 工具,为 7000 多家广告主生成约 2 万个创意。
Cloudflare 在 Birthday Week 期间开源 Clef 系列决策模型,包含 27B 多模态模型和面向低延迟的 9B Clef-Flash,输入状态与带类型的问题 schema,单次前向传播返回每个选项的概率,不生成自由文本。
OpenAI 在 ChatGPT 上线 Intelligent UI 能力,GPT-6 可在聊天框内实时生成带排版、按钮、表单、图表和交互控件的界面,首批覆盖 Plus、Pro、Team、Business 和 Enterprise 付费版本,免费版和 Go 版本次日更新。
OpenAI 支持在对话中直接创建可交互工具,例如游戏或交互式预算规划计算器。该功能让用户无需离开对话即可使用这些工具。
《Building Microservices》作者 Sam Newman 在新书《Building Resilient Distributed Systems》中提出分布式系统三法则:信息传输需要时间、资源可能离线、资源并非无限,并指出多数故障源于资源耗尽。
Latent Space 采访了 Kubernetes 联合创造者 Craig McLuckie 和 Joe Beda,他们创办的 Stacklok 正把编码 Agent 从桌面搬到云端。
InfoQ 将于 10 月 14 日举办免费 60 分钟线上研讨会“AI in Production: What Breaks, What Works, and Who Approves It?
The Pragmatic Engineer 在 LDX3 工程领导力大会的主题演讲给出 2026 年科技行业快照:几乎没人再手写代码,同时运行 5-10 个 Agent 已成常态,IDE 正在淡化。