OpenRSI Index 发布:用数千至上万 H100·小时的真实训练任务评测科研智能体
OpenRSI Index 近日在 X 上引发关注,它从 Marin、Qwen、GPIC 等真实开源研究项目出题,让智能体在预训练、后训练与图像生成任务上改进人类设计的训练方案,单次运行算力达 5,815 至 20,864 H100·小时。
OpenRSI Index 近日在 X 上引发关注,它从 Marin、Qwen、GPIC 等真实开源研究项目出题,让智能体在预训练、后训练与图像生成任务上改进人类设计的训练方案,单次运行算力达 5,815 至 20,864 H100·小时。
Google 发布 Android Bench 2.0,新增长周期任务(LHT)、Agent 评测与连续评分,取代此前的二元通过/失败判定。LHT 指需工程师数天甚至一周完成的复杂任务,如升级依赖、从零构建应用、将跨平台应用迁移到 Android。
Aether AI 发布机器人系统 CRIS-0,采用因果驱动架构,将高层任务规划与低层物理预测分离,并引入因果世界模型推演动作后果。系统用任务图组织执行流程,每个节点对应可验证阶段,某步失败时可退回上一成功节点重新评估并尝试替代方案。实验显示 CRIS-0 在灯光变化、物体移动等突发干扰下能迅速调整策略,长程模糊指令执行中的错误恢复能力显著提升。
斯坦福大学李飞飞、吴佳俊、Ehsan Adeli 团队提出开放世界动作建模框架 OpenWAM,基于 Wan2.2-5B 视频模型做因果化预训练,并用共享 MoT 架构组合 5B 视频专家与 2B 动作专家,定义 VTA、ATV、Joint、Decoupled 四种交互程序。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 219 个 pull request、覆盖 19 种语言。
推荐理由:GitHub 公开了代码审查基准的构建方法与评分口径,读者可据此判断自家审查 Agent 的强弱项。
Anthropic 成立生命科学研究组与实验室,让 Claude 自主挖掘 DNA 数据。约 950 个 agent 用 210 million tokens 搜索 21 小时。