OpenRSI Index 发布:用数千至上万 H100·小时的真实训练任务评测科研智能体
OpenRSI Index 近日在 X 上引发关注,它从 Marin、Qwen、GPIC 等真实开源研究项目出题,让智能体在预训练、后训练与图像生成任务上改进人类设计的训练方案,单次运行算力达 5,815 至 20,864 H100·小时。
OpenRSI Index 近日在 X 上引发关注,它从 Marin、Qwen、GPIC 等真实开源研究项目出题,让智能体在预训练、后训练与图像生成任务上改进人类设计的训练方案,单次运行算力达 5,815 至 20,864 H100·小时。
Google 发布 Android Bench 2.0,新增长周期任务(LHT)、Agent 评测与连续评分,取代此前的二元通过/失败判定。LHT 指需工程师数天甚至一周完成的复杂任务,如升级依赖、从零构建应用、将跨平台应用迁移到 Android。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 219 个 pull request、覆盖 19 种语言。
推荐理由:GitHub 公开了代码审查基准的构建方法与评分口径,读者可据此判断自家审查 Agent 的强弱项。
作者用 29 个 LLM 测试代码质量并更新了排行榜,新增 GLM-5.3-Flash(原 Ox Alpha)在 21 个编码提示词上的测试,以及 Qwen 3.8-Flash 在 20 个提示词上的测试。
JetBrains 用 80 组配对任务实测 Claude Code 的 ponytail skill,实测代码量减少 15%、成本降 10.3%、耗时降 11%,约为宣传值(-54% 代码、-22% tokens、-20% 成本、-27% 时间)的四分之一到一半,但这是该系列首个成本节省信号统计上可靠的插件。