中科大团队白泽通境推出溯因式世界模型 AWM,成立三个月获数千万元融资
中科大团队创立的白泽通境推出溯因式世界模型 AWM,先预测再溯因,在 Push-T 任务上仅用 2,000 条轨迹达到 75% 成功率,约为 Causal-JEPA 所需数据的七分之一。
中科大团队创立的白泽通境推出溯因式世界模型 AWM,先预测再溯因,在 Push-T 任务上仅用 2,000 条轨迹达到 75% 成功率,约为 Causal-JEPA 所需数据的七分之一。
OpenRSI Index 近日在 X 上引发关注,它从 Marin、Qwen、GPIC 等真实开源研究项目出题,让智能体在预训练、后训练与图像生成任务上改进人类设计的训练方案,单次运行算力达 5,815 至 20,864 H100·小时。
陶哲轩在加州理工学院发表 Math 2.0 演讲,称 AI 正把数学从证明匮乏时代推入证明充沛时代,传统以解题为核心的评价体系已错位。他指出网上 AI 攻破数学难题的捷报属于幸存者偏差,当前数学前沿绝大多数核心问题仍未解决,AI 直接从问题跳到答案会跨过人类理解。Math 2.0 的实践包括用开源 AI 重构四色定理、ABC 猜想等证明,等式理论项目已判定超 2200 万个命题真伪。
Google 发布 Android Bench 2.0,新增长周期任务(LHT)、Agent 评测与连续评分,取代此前的二元通过/失败判定。LHT 指需工程师数天甚至一周完成的复杂任务,如升级依赖、从零构建应用、将跨平台应用迁移到 Android。
Aether AI 发布机器人系统 CRIS-0,采用因果驱动架构,将高层任务规划与低层物理预测分离,并引入因果世界模型推演动作后果。系统用任务图组织执行流程,每个节点对应可验证阶段,某步失败时可退回上一成功节点重新评估并尝试替代方案。实验显示 CRIS-0 在灯光变化、物体移动等突发干扰下能迅速调整策略,长程模糊指令执行中的错误恢复能力显著提升。
斯坦福大学李飞飞、吴佳俊、Ehsan Adeli 团队提出开放世界动作建模框架 OpenWAM,基于 Wan2.2-5B 视频模型做因果化预训练,并用共享 MoT 架构组合 5B 视频专家与 2B 动作专家,定义 VTA、ATV、Joint、Decoupled 四种交互程序。
Coleman Parkes 代表 Undo 对 300 位负责关键任务软件的资深工程负责人调研发现,AI 编码 Agent 虽加快了代码生成,却把主要瓶颈转移到调试、代码理解和维护。
OpenAI 公开了一个尚未发布的内部前沿模型产出的 722 篇数学手稿,归入 372 个成果族,覆盖 17 个方向,其中 235 族附带 Lean 形式化证明。
OpenAI 发布 722 篇由 AI 撰写的数学论文并打包上传至 GitHub,平均每个难题解法消耗 ChatGPT Pro 深度思考约三小时算力,同步给出大量 Lean 代码供机器核验,技术细节与模型推理过程全部开源。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 219 个 pull request、覆盖 19 种语言。
推荐理由:GitHub 公开了代码审查基准的构建方法与评分口径,读者可据此判断自家审查 Agent 的强弱项。
Anthropic 成立生命科学研究组与实验室,让 Claude 自主挖掘 DNA 数据。约 950 个 agent 用 210 million tokens 搜索 21 小时。