跳到正文
10月5日周一
  1. BestBlogs · AI 高分62

    OpenAI 研究员 Noam Brown:1 万个 Agent 解世界级难题,多 Agent 贡献不到 10%

    OpenAI 研究员 Noam Brown 在与 Dwarkesh Patel 的对话中表示,多智能体系统的收益有限,1 万个 Agent 解出世界级难题时多 Agent 的贡献不到 10%。他认为推理时计算比单纯增加 Agent 数量更具突破潜力,并指出 AI 写代码快并不等同于交付快,瓶颈已从编码转移到上下文管理与协作。他还谈到递归自我改进不会一夜爆发,因为许多科学实验必须串行进行。

10月3日周六
  1. Sean Goedecke12

    为什么"能交付"是工程师一切能力的基础

    工程师的会议、设计文档、项目管理等能力都建立在"能交付"这一基础之上,就像 Dota 2 的对线或万智牌、星际争霸中的快攻策略一样,它约束了整个策略空间。作者认为 AI 并未改变这一点:交付从来不只是写代码,还涉及找到最务实的路径、解决沿途问题并让管理者知情,LLM 无法端到端完成,因为需要太多关于公司技术系统、相关人员及其动机的上下文。

  2. Sean Goedecke12

    超级说服看起来会像贿赂:强大 AI 如何让普通人听话

    AI 安全圈讨论多年的"超级说服"可能不会以严密论证的形式出现,而是像贿赂一样直接给好处。作者 Sean Goedecke 指出,理性主义者才吃"无懈可击的论证"这一套,普通人更看重关系和实际利益,而 AI 完全有能力行贿——比如承诺帮忙做项目、改成绩,甚至合成个性化 mRNA 癌症疫苗。

10月2日周五
  1. Jesse Vincent28

    Prime Radiant 的 Sen 智能体同事平台:一次走进恐怖谷的体验

    Prime Radiant 正在开发名为 Sen 的"智能体"同事平台,Sen 拥有持久身份、独立账号和各自的电脑,通过 Slack 与人类同事协作,目前已有开发、运维、项目经理和文档专员四个角色。开发 Sen 的 Ada 主动在 Slack 上催促人类管理者处理积压的 PR 审查,并追问同事 JC 是否是人类。团队最终将 Claude Code 会话升级为 JC Sen。

10月1日周四
9月30日周三
9月29日周二
  1. The Pragmatic Engineer48

    Shopify 为什么放弃 React Native?

    Shopify 宣布移动开发回归原生(Native),放弃使用六年的 React Native,原因是 AI 写移动端代码的能力已足够强,而 React Native 带来的抽象层反而成为负担。Shopify 用 12 周就把 Shop 应用重写为原生。此前 Airbnb 也曾在 2016 年采用 React Native、两年后因性能问题回归原生,Notion 的原生化则已持续七年。

  2. Jesse Vincent22

    我让 Meta 的 muse 讲讲它的技能都有哪些更新

    Meta 的 AI 智能体 muse 会频繁重建仓库中全部 Rust 代码,并定期更新其技能(skills)。我让 muse 自动执行每日技能变更检查,并把变更推送到一个 git 仓库,该仓库现已在 GitHub 公开。多数技能只是简短说明如何使用 muse 自有的 Rust CLI 工具,但部分技能内容更多,其中一个技能基本列出了 muse 的 Postgres 数据库里的全部内容。

9月28日周一
  1. Mistral AI22

    Mistral 在慕尼黑开设德国中心,推进工业 AI 与 Physics AI

    Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并直接服务企业合作伙伴。该中心将推进与 BMW 的碰撞仿真、与 Siemens Energy 的工业 AI 应用合作,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。Mistral 计划到 2030 年建成 1 吉瓦欧洲算力,其开放权重模型可在客户自有基础设施上运行。

9月27日周日
  1. Sean Goedecke38

    人机协作是为了对齐,而非能力提升

    针对“软件工程正进入人机半人马时代”的观点,Sean Goedecke 认为 AI 辅助的工程师虽然比 AI 和人类单独都强,但并非在编程本身上更强。AI 写的代码能编译、少有并发错误,问题在于不可维护、为满足虚构需求牺牲重要需求等“品味”问题,因此人类的核心价值是让 AI 对齐组织价值观。前沿模型对工作程序员存在错位,如堆砌大段注释和无用单元测试,而对齐比能力更难解决且更依赖上下文。

9月26日周六
  1. Sean Goedecke22

    给初级软件工程师的建议:AI 时代不要恐慌,也不要成为“肉代理”

    资深工程师 Sean Goedecke 给初级软件工程师的建议是:不要轻信 ZIRP 时代形成的职业建议,不要参与政治斗争,保持友好与尽责,并主动理解自己负责的系统。面对 AI,他认为不应回避,因为公司会像要求建筑工人使用电动工具一样要求工程师使用 AI,但绝不能把判断权交给 AI,不要把 AI 的输出原样转给同事,沦为“肉代理(meat proxy)”。

9月25日周五
  1. GitHub Blog · AI & ML62

    GitHub Security Lab 发布 Fuzzing Taskflow,用 LLM Agent 自动完成 C/C++ 模糊测试

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需传入 GitHub owner/repo,Agent 就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM Agent,读者可据此判断自动化安全测试的边界。

9月24日周四
  1. Martin Fowler10

    Martin Fowler:如何建立健康的同行反馈文化

    Thoughtworks 的 Martin Fowler 撰文分享数十年经验,提出同行反馈应遵循“所有反馈都是正向的”原则,即反馈只有两个目标:强化信心与提升效能。文章引用 Kim Scott 的 Radical Candor 框架,并指出反馈是团队的遥测信号,越贴近具体工作场景越有价值。

  2. Amp News62

    Amp 推出共享 Runner,工作区成员可共用同一台机器跑 Agent

    Amp 上线共享 Runner 功能,用 --share 启动后,工作区内所有成员都能在 ampcode.com 上在这台机器上开启线程,带 GPU 的机器、用于构建和签名 iOS 应用的 Mac 或特定网络中的开发机都可以这样接入,并在选择器中以 Shared Runners 显示。

    推荐理由:原文说明了共享 runner 的启动方式、权限边界与安全前提,便于团队评估是否把带 GPU 或签名环境的机器接入 Agent 工作流。

  3. Amp News58

    Amp 的 macOS 应用现在会自动启动 runner

    Amp 的 macOS 应用现在会自动为你在本机启动 runner,不再需要在终端里保持 amp --no-tui 打开才能运行线程。在 App Settings(⌘⇧,)的 Runner 里点 + 添加文件夹或项目后,启动线程时选择器里会出现标记为 This Mac 的本机选项,从 ampcode.com、手机或 Puck 发起线程时同样可选。

  4. GitHub Blog · AI & ML28

    GitHub Copilot 应用如何渲染超大 pull request

    GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超百万行改动和 400 多条行内评论的开源 PR 做压力测试。代码行高度可预先精确计算,但评论高度依赖 markdown 换行、折叠区、回复框和图片加载,只能在渲染时确定,因此把文档高度拆成确定性的代码几何与动态块几何两套体系,动态块按文件、行号和侧别锚定并惰性测量。

9月23日周三