跳到正文
10月9日周五
10月8日周四
10月7日周三
10月5日周一
  1. BestBlogs · AI 高分62

    OpenAI 研究员 Noam Brown:1 万个 Agent 解世界级难题,多 Agent 贡献不到 10%

    OpenAI 研究员 Noam Brown 在与 Dwarkesh Patel 的对话中表示,多智能体系统的收益有限,1 万个 Agent 解出世界级难题时多 Agent 的贡献不到 10%。他认为推理时计算比单纯增加 Agent 数量更具突破潜力,并指出 AI 写代码快并不等同于交付快,瓶颈已从编码转移到上下文管理与协作。他还谈到递归自我改进不会一夜爆发,因为许多科学实验必须串行进行。

10月1日周四
9月27日周日
  1. Sean Goedecke38

    人机协作是为了对齐,而非能力提升

    针对“软件工程正进入人机半人马时代”的观点,Sean Goedecke 认为 AI 辅助的工程师虽然比 AI 和人类单独都强,但并非在编程本身上更强。AI 写的代码能编译、少有并发错误,问题在于不可维护、为满足虚构需求牺牲重要需求等“品味”问题,因此人类的核心价值是让 AI 对齐组织价值观。前沿模型对工作程序员存在错位,如堆砌大段注释和无用单元测试,而对齐比能力更难解决且更依赖上下文。

9月24日周四
9月18日周五
9月14日周一
9月7日周一
9月5日周六
9月1日周二
  1. Zed Blog36

    Zed 谈 Xanadu 为何在等待 AI 智能体

    Zed 认为 Ted Nelson 的 Xanadu 超文本构想之所以长期无法落地,是因为缺少能耐心追踪每一层引用的用户,而 AI 智能体正好补上这一环。DeltaDB 用 Lamport 时间戳、Merkle 树、CRDT、廉价存储、常连网络和 Firecracker 级微虚拟机等六十年积累的组件,实现"永不复制、只引用,永不覆盖、只版本化"的 xanalogical 计算。

8月31日周一
8月25日周二
8月21日周五
8月8日周六
  1. Addy Osmani50

    Addy Osmani:Agentic Code Quality——用约束与质量门禁替代逐行代码审查

    Addy Osmani 提出,Agent 每天产生数十万乃至上百万次代码变更,逐行代码审查已不可行,软件质量转而取决于围绕 Agent 设置的约束,即质量门禁。这些门禁包括单元测试、属性测试、验收测试、变异测试,以及圈复杂度和行长等代码质量指标,并贯穿 Agent 从解释器到控制器再到生产的全流程。人类注意力应只投向自动化护栏失效时的复杂问题,否则会拖慢机器速度的流程。

7月28日周二
  1. 宝玉的分享22

    关于 Agent 的几个判断:通用 Agent 通吃、插件生态与模型护城河

    针对 @cellier_ 提出的通用 Agent 吃掉垂直 Agent、开放吃掉封闭、下沉吃掉傲慢三个判断,宝玉补充了自己的六点看法:通用 Agent 赛道本身也会是少数赢家通吃,小通用 Agent 同样没有生存空间;开放与封闭的差别不在开源或模型切换,而在插件生态,Skill 加 MCP 是关键。

7月20日周一
  1. Addy Osmani38

    Addy Osmani:软件工厂的明与暗——从循环、Harness 到无人审查的暗工厂

    Addy Osmani 提出软件工厂由循环、Harness、工厂三层构成:循环是单个 Agent 重复执行任务的最小单元,Harness 是沙箱、工具、记忆与完成判定,工厂则是多个 Harness 化循环共用一个审查门。明工厂保留人类判断,暗工厂让 Agent 自行定范围、构建并发布代码,无人阅读细节。他指出图中生成、测试、扫描几乎零成本,唯一难以扩展的是审查门这一"判断"环节。

7月15日周三
6月19日周五
  1. Steve Yegge32

    Steve Yegge:AI 模型能力曲线为何对大多数人"变平"

    Steve Yegge 提出"平坦曲线社会":模型智能仍在指数增长,但最强大的模型将被各国政府像核武器一样管制,多数企业和开发者只能用到 Fable 级模型。他指出开源模型落后前沿约七个月,且难以突破 Fable 级,因为算力供应链正被锁定。他还提出"辨识地平线"概念,认为用户因缺乏足够难的问题而无法区分更强模型。