田渊栋:与 GPT-5 合写最后一篇论文后,我意识到自己 5 年内会失业
前 Meta FAIR 研究员、Recursive Superintelligence 联合创始人田渊栋在播客中透露,他用 GPT-5 作为合作者完成在 Meta 的最后一篇论文(研究 grokking 现象),效率提升约 6 到 10 倍,并由此意识到自己的工作大概五年内会被取代。他认为当前模型仍无法在无人类干预下产出好想法,人类仍需负责发起问题和验证方案,而最难自动化的是提出想法。
前 Meta FAIR 研究员、Recursive Superintelligence 联合创始人田渊栋在播客中透露,他用 GPT-5 作为合作者完成在 Meta 的最后一篇论文(研究 grokking 现象),效率提升约 6 到 10 倍,并由此意识到自己的工作大概五年内会被取代。他认为当前模型仍无法在无人类干预下产出好想法,人类仍需负责发起问题和验证方案,而最难自动化的是提出想法。
ChatGPT 共同创造者、OpenAI 前后训练负责人 Liam Fedus 在播客 The Frontier 中表示,数学因自带 Lean 形式化验证这一"裁判"而成为 AI 突破最快的科学领域,但材料科学等物质世界问题必须靠真实实验验证。
微软发布 Microsoft-Decision-1,一个专做选择题的决策模型,基于阿里开源模型 Qwen3.5-9B 后训练,只做一遍推理就输出结构化结果和校准过的概率分。
Aether AI 发布因果驱动的机器人智能系统 CRIS-0,由因果驱动机器人 Agent 与因果世界模型两大组件构成,在真实机器人演示中面对人为干扰的反应速度达 0.1s 级。
Aether AI 发布机器人系统 CRIS-0,采用因果驱动架构,将高层任务规划与低层物理预测分离,并引入因果世界模型推演动作后果。系统用任务图组织执行流程,每个节点对应可验证阶段,某步失败时可退回上一成功节点重新评估并尝试替代方案。实验显示 CRIS-0 在灯光变化、物体移动等突发干扰下能迅速调整策略,长程模糊指令执行中的错误恢复能力显著提升。
Periodic Labs 的 Liam Fedus 与 Ekin Dogus Cubuk 在播客中提出“合成超级智能”,主张 AI 科学发现应靠扎根物理实验的强化学习,而非只训练更多互联网数据。他们讨论材料发现闭环中的预测、合成与表征,DFT 与仿真,以及让每台实验仪器具备“140 IQ”的高通量自主实验室。两人认为失败实验可能是最有价值的训练数据,自主实验有望把数十年的试错压缩到数月。
一篇科普综述剖析了大模型底层的分词机制:模型读到的不是字母,而是分词器生成的数字编号字块,因此无法准确数清字母 r。文章指出 BPE 算法靠反复合并高频字符对来压缩文本,代价是算术与字符分析能力缺陷、低资源语言成本上升,以及冷门字块带来的安全漏洞。学界正探索直接读字节、动态切分和视觉化文字等替代方案,但替换现有分词地基的训练与评测成本很高。
生数科技推出视频生成模型 Vidu Q4 Preview,将生成成本压至 0.09 元/秒,图生视频速度达同类模型的 2 倍。该预览版支持最多 15 张参考图、参考音色输入与 2K/4K 画质输出,并提升了人物演绎、镜头调度和复杂特效表现。
Mistral 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、520 亿激活参数的原生多模态模型,权重将于本月底开放。
推荐理由:Mistral 官方给出 ML4 的完整能力清单与开源权重时间表,可据此判断欧洲开源模型在编码与智能体任务上的位置。
OpenAI 研究员 Noam Brown 在与 Dwarkesh Patel 的对话中表示,多智能体系统的收益有限,1 万个 Agent 解出世界级难题时多 Agent 的贡献不到 10%。他认为推理时计算比单纯增加 Agent 数量更具突破潜力,并指出 AI 写代码快并不等同于交付快,瓶颈已从编码转移到上下文管理与协作。他还谈到递归自我改进不会一夜爆发,因为许多科学实验必须串行进行。
Ollama 0.35 通过新的 /v1/systemone 端点支持基于 TypeSafe Jev API 的决策模型,可一次性提交文本状态和一组命名问题并本地作答。
Gemini 3.7 Flash 借助新的智能体视频理解能力,可自动调整处理速度,准确识别并数清每一次拍手。AI 处理视频默认固定 1 FPS,拍手这类瞬间动作容易被漏掉或与响指、点击声混淆。
Google DeepMind 推出 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供,新增场景延展、首尾帧插值、4K 升采样等生成视频控制能力。
Ollama 0.31 让 Gemma 4 在 Apple Silicon 上生成 token 平均提速近 90%,该加速默认开启且不改变模型输出。提速来自多 token 预测(MTP):Gemma 4 附带一个小型草稿模型,先提出后续若干 token,主模型一次验证并保留一致的部分,代码场景因可预测性高而受益明显。
推荐理由:原文给出 MTP 加速的实测数据与实现细节,读者可据此判断本地编码 Agent 的响应速度变化。
Ollama 更新 MLX 引擎,称在 Apple Silicon 上达到迄今最高性能,支持 NVIDIA 的 NVFP4 格式,输出速度最高提升 20%,并减少内存占用。
推荐理由:原文给出 MLX 引擎在 Apple Silicon 上的量化、速度与快照机制变化,可据此判断本地跑 Agent 的收益。