跳到正文
10月7日周三
10月6日周二
10月5日周一
  1. BestBlogs · AI 高分62

    OpenAI 研究员 Noam Brown:1 万个 Agent 解世界级难题,多 Agent 贡献不到 10%

    OpenAI 研究员 Noam Brown 在与 Dwarkesh Patel 的对话中表示,多智能体系统的收益有限,1 万个 Agent 解出世界级难题时多 Agent 的贡献不到 10%。他认为推理时计算比单纯增加 Agent 数量更具突破潜力,并指出 AI 写代码快并不等同于交付快,瓶颈已从编码转移到上下文管理与协作。他还谈到递归自我改进不会一夜爆发,因为许多科学实验必须串行进行。

10月3日周六
  1. Sean Goedecke12

    超级说服看起来会像贿赂:强大 AI 如何让普通人听话

    AI 安全圈讨论多年的"超级说服"可能不会以严密论证的形式出现,而是像贿赂一样直接给好处。作者 Sean Goedecke 指出,理性主义者才吃"无懈可击的论证"这一套,普通人更看重关系和实际利益,而 AI 完全有能力行贿——比如承诺帮忙做项目、改成绩,甚至合成个性化 mRNA 癌症疫苗。

10月2日周五
  1. Jesse Vincent28

    Prime Radiant 的 Sen 智能体同事平台:一次走进恐怖谷的体验

    Prime Radiant 正在开发名为 Sen 的"智能体"同事平台,Sen 拥有持久身份、独立账号和各自的电脑,通过 Slack 与人类同事协作,目前已有开发、运维、项目经理和文档专员四个角色。开发 Sen 的 Ada 主动在 Slack 上催促人类管理者处理积压的 PR 审查,并追问同事 JC 是否是人类。团队最终将 Claude Code 会话升级为 JC Sen。

10月1日周四
9月29日周二
  1. The Pragmatic Engineer48

    Shopify 为什么放弃 React Native?

    Shopify 宣布移动开发回归原生(Native),放弃使用六年的 React Native,原因是 AI 写移动端代码的能力已足够强,而 React Native 带来的抽象层反而成为负担。Shopify 用 12 周就把 Shop 应用重写为原生。此前 Airbnb 也曾在 2016 年采用 React Native、两年后因性能问题回归原生,Notion 的原生化则已持续七年。

  2. Jesse Vincent22

    我让 Meta 的 muse 讲讲它的技能都有哪些更新

    Meta 的 AI 智能体 muse 会频繁重建仓库中全部 Rust 代码,并定期更新其技能(skills)。我让 muse 自动执行每日技能变更检查,并把变更推送到一个 git 仓库,该仓库现已在 GitHub 公开。多数技能只是简短说明如何使用 muse 自有的 Rust CLI 工具,但部分技能内容更多,其中一个技能基本列出了 muse 的 Postgres 数据库里的全部内容。

9月28日周一
9月27日周日
  1. Sean Goedecke38

    人机协作是为了对齐,而非能力提升

    针对“软件工程正进入人机半人马时代”的观点,Sean Goedecke 认为 AI 辅助的工程师虽然比 AI 和人类单独都强,但并非在编程本身上更强。AI 写的代码能编译、少有并发错误,问题在于不可维护、为满足虚构需求牺牲重要需求等“品味”问题,因此人类的核心价值是让 AI 对齐组织价值观。前沿模型对工作程序员存在错位,如堆砌大段注释和无用单元测试,而对齐比能力更难解决且更依赖上下文。

9月26日周六
  1. Sean Goedecke22

    给初级软件工程师的建议:AI 时代不要恐慌,也不要成为“肉代理”

    资深工程师 Sean Goedecke 给初级软件工程师的建议是:不要轻信 ZIRP 时代形成的职业建议,不要参与政治斗争,保持友好与尽责,并主动理解自己负责的系统。面对 AI,他认为不应回避,因为公司会像要求建筑工人使用电动工具一样要求工程师使用 AI,但绝不能把判断权交给 AI,不要把 AI 的输出原样转给同事,沦为“肉代理(meat proxy)”。

9月25日周五
  1. GitHub Blog · AI & ML62

    GitHub Security Lab 发布 Fuzzing Taskflow,用 LLM Agent 自动完成 C/C++ 模糊测试

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需传入 GitHub owner/repo,Agent 就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM Agent,读者可据此判断自动化安全测试的边界。

9月24日周四
9月23日周三
9月22日周二
  1. Amp News62

    Amp runner 支持创建 Git worktree 并读取 Secrets 环境变量

    Amp 的 runner 现在可以创建 Git worktree:在目录选择器里选中仓库按 Tab 并命名分支,线程就会在新建的独立 checkout 中启动,主 checkout 不受影响,未提交的改动仍留在原处。

    推荐理由:原文给出 runner 创建 Git worktree 与读取 Secrets 的具体操作路径,可据此判断多分支并行开发流程的变化。

  2. Jesse Vincent8

    Simon Willison 与 Jesse Vincent 将在旧金山举办 Agentic Engineering 小型交流活动

    Simon Willison 和 Jesse Vincent 将于 10 月 14 日晚在旧金山举办一场关于 agentic engineering 的小型线下交流活动,约三周后举行,可通过 Luma 报名。活动面向正在尝试和实验的开发者,鼓励分享尚未公开的工作、奇怪实验和未完成项目,形式为一场非正式的自由对话与展示,不要求上台演讲。

9月21日周一
9月18日周五
9月17日周四
  1. Martin Fowler12

    Martin Fowler:我不喜欢 LLM

    Martin Fowler 撰文表示,尽管他认可 LLM 能带来生产力提升、且"不使用反而不负责任",但他对与 LLM 直接交互本身抱有强烈的反感:它们用令人不适的"LLM 腔"说话,自信地胡说八道,被指出错误时也只表现出虚假的歉意。他认为 LLM 是硅谷 brogrammer 亚文化的产物,被创造者的价值观所塑造,因此不应把 AI 智能体拟人化。

9月16日周三
9月15日周二
9月14日周一
9月10日周四
  1. Cursor 更新日志88

    Cursor 发布 Projects:协调者 Agent 调度云端子 Agent 承接长期任务

    Cursor 推出 Projects,用于承接功能开发、迁移或完整应用等更大规模的工作,可跨数月维持上下文、把任务分派给大量子 Agent,并在无需提示的情况下执行周期性工作。

    推荐理由:官方说明 Projects 如何用协调者 Agent 与云端并行子 Agent 承接跨月的大型开发任务,可据此判断长周期工作流的组织方式。

9月7日周一
9月5日周六
9月2日周三
  1. 宝玉的分享62

    Anthropic 博客:高效电商 AI 智能体的架构、延迟成本优化与评估实践

    Anthropic 发布电商 AI 智能体解剖指南,基于与零售、电商平台、旅游、娱乐和电信团队的 Claude 生产部署经验,提出把 Claude 放进标准智能体循环、用技能覆盖长尾需求、用工具调用现有系统的单一智能体架构,并称该架构在对比测试中质量优于全塞进提示词或子智能体方案。

9月1日周二
  1. Zed Blog36

    Zed 谈 Xanadu 为何在等待 AI 智能体

    Zed 认为 Ted Nelson 的 Xanadu 超文本构想之所以长期无法落地,是因为缺少能耐心追踪每一层引用的用户,而 AI 智能体正好补上这一环。DeltaDB 用 Lamport 时间戳、Merkle 树、CRDT、廉价存储、常连网络和 Firecracker 级微虚拟机等六十年积累的组件,实现"永不复制、只引用,永不覆盖、只版本化"的 xanalogical 计算。

8月31日周一