跳到正文
今天10月11日周日3 条
  1. 机器之心38

    田渊栋:与 GPT-5 合写最后一篇论文后,我意识到自己 5 年内会失业

    前 Meta FAIR 研究员、Recursive Superintelligence 联合创始人田渊栋在播客中透露,他用 GPT-5 作为合作者完成在 Meta 的最后一篇论文(研究 grokking 现象),效率提升约 6 到 10 倍,并由此意识到自己的工作大概五年内会被取代。他认为当前模型仍无法在无人类干预下产出好想法,人类仍需负责发起问题和验证方案,而最难自动化的是提出想法。

  2. BestBlogs · AI 高分28

    和 ColaOS 橘子聊个人 Agent 这半年:时代追上了他,他却打了转向灯

    ColaOS 创始人橘子复盘个人 Agent 半年变化:云端部署加 flash 级模型(如 DeepSeek Flash、Haiku 5.5)把单用户月成本从几百美元压到约十美元,补贴 token 已低于获客成本,免费打法回归,6 到 18 个月前因成本砸掉的产品值得重做。他放弃卷办公场景,转向「996 之外」的副业与技能变现,今年目标先做到盈亏平衡。

10月10日周六
  1. Sean Goedecke22

    软件工程的半人马时代或将持续数十年

    软件工程正处在人类工程师与 AI 编码系统协作的"半人马时代",这种组合目前比任何一方单独工作都更高效。作者以国际象棋的半人马时代持续约二十年、针织业长达两百年为例,认为软件工程的这一阶段可能还会延续一二十年。当前 Agent 自 2025 年 11 月 Claude Opus 4.5 发布后已可完全无监督运行,但输出仍需人工审查,错误更多属于对齐问题而非普通 bug。

10月9日周五
  1. Latent Space22

    Periodic Labs 的 Liam Fedus 与 Ekin Dogus Cubuk 谈“合成超级智能”:从半导体到超导体

    Periodic Labs 的 Liam Fedus 与 Ekin Dogus Cubuk 在播客中提出“合成超级智能”,主张 AI 科学发现应靠扎根物理实验的强化学习,而非只训练更多互联网数据。他们讨论材料发现闭环中的预测、合成与表征,DFT 与仿真,以及让每台实验仪器具备“140 IQ”的高通量自主实验室。两人认为失败实验可能是最有价值的训练数据,自主实验有望把数十年的试错压缩到数月。

10月8日周四
10月7日周三
10月5日周一
  1. BestBlogs · AI 高分62

    OpenAI 研究员 Noam Brown:1 万个 Agent 解世界级难题,多 Agent 贡献不到 10%

    OpenAI 研究员 Noam Brown 在与 Dwarkesh Patel 的对话中表示,多智能体系统的收益有限,1 万个 Agent 解出世界级难题时多 Agent 的贡献不到 10%。他认为推理时计算比单纯增加 Agent 数量更具突破潜力,并指出 AI 写代码快并不等同于交付快,瓶颈已从编码转移到上下文管理与协作。他还谈到递归自我改进不会一夜爆发,因为许多科学实验必须串行进行。

10月3日周六
  1. Sean Goedecke12

    超级说服看起来会像贿赂:强大 AI 如何让普通人听话

    AI 安全圈讨论多年的"超级说服"可能不会以严密论证的形式出现,而是像贿赂一样直接给好处。作者 Sean Goedecke 指出,理性主义者才吃"无懈可击的论证"这一套,普通人更看重关系和实际利益,而 AI 完全有能力行贿——比如承诺帮忙做项目、改成绩,甚至合成个性化 mRNA 癌症疫苗。

10月2日周五
  1. Jesse Vincent28

    Prime Radiant 的 Sen 智能体同事平台:一次走进恐怖谷的体验

    Prime Radiant 正在开发名为 Sen 的"智能体"同事平台,Sen 拥有持久身份、独立账号和各自的电脑,通过 Slack 与人类同事协作,目前已有开发、运维、项目经理和文档专员四个角色。开发 Sen 的 Ada 主动在 Slack 上催促人类管理者处理积压的 PR 审查,并追问同事 JC 是否是人类。团队最终将 Claude Code 会话升级为 JC Sen。

10月1日周四
9月29日周二
9月27日周日
  1. Sean Goedecke38

    人机协作是为了对齐,而非能力提升

    针对“软件工程正进入人机半人马时代”的观点,Sean Goedecke 认为 AI 辅助的工程师虽然比 AI 和人类单独都强,但并非在编程本身上更强。AI 写的代码能编译、少有并发错误,问题在于不可维护、为满足虚构需求牺牲重要需求等“品味”问题,因此人类的核心价值是让 AI 对齐组织价值观。前沿模型对工作程序员存在错位,如堆砌大段注释和无用单元测试,而对齐比能力更难解决且更依赖上下文。

9月26日周六
  1. Sean Goedecke22

    给初级软件工程师的建议:AI 时代不要恐慌,也不要成为“肉代理”

    资深工程师 Sean Goedecke 给初级软件工程师的建议是:不要轻信 ZIRP 时代形成的职业建议,不要参与政治斗争,保持友好与尽责,并主动理解自己负责的系统。面对 AI,他认为不应回避,因为公司会像要求建筑工人使用电动工具一样要求工程师使用 AI,但绝不能把判断权交给 AI,不要把 AI 的输出原样转给同事,沦为“肉代理(meat proxy)”。

9月24日周四
9月18日周五
9月17日周四
  1. Martin Fowler12

    Martin Fowler:我不喜欢 LLM

    Martin Fowler 撰文表示,尽管他认可 LLM 能带来生产力提升、且"不使用反而不负责任",但他对与 LLM 直接交互本身抱有强烈的反感:它们用令人不适的"LLM 腔"说话,自信地胡说八道,被指出错误时也只表现出虚假的歉意。他认为 LLM 是硅谷 brogrammer 亚文化的产物,被创造者的价值观所塑造,因此不应把 AI 智能体拟人化。

9月14日周一
9月5日周六
9月1日周二
  1. Zed Blog36

    Zed 谈 Xanadu 为何在等待 AI 智能体

    Zed 认为 Ted Nelson 的 Xanadu 超文本构想之所以长期无法落地,是因为缺少能耐心追踪每一层引用的用户,而 AI 智能体正好补上这一环。DeltaDB 用 Lamport 时间戳、Merkle 树、CRDT、廉价存储、常连网络和 Firecracker 级微虚拟机等六十年积累的组件,实现"永不复制、只引用,永不覆盖、只版本化"的 xanalogical 计算。

8月31日周一
8月25日周二
8月24日周一
  1. Armin Ronacher17

    Armin Ronacher:面对 AI,与其愤怒不如保持好奇与焦虑

    Armin Ronacher 撰文回应"在当下科技行业怎么可能不愤怒"的提问,认为面对 AI 更合理的情绪是迷茫与焦虑而非愤怒,因为愤怒需要一个可归咎的对象,而 AI 带来的冲击让每个人都难以看清未来。他建议用不确定感取代愤怒,因为它能通向好奇心,进而带来实验与行动的自由;许多公开表现自信的从业者私下同样充满不确定,只是在用信心为自己争取筹码。

8月22日周六
8月21日周五
8月8日周六
  1. Addy Osmani50

    Addy Osmani:Agentic Code Quality——用约束与质量门禁替代逐行代码审查

    Addy Osmani 提出,Agent 每天产生数十万乃至上百万次代码变更,逐行代码审查已不可行,软件质量转而取决于围绕 Agent 设置的约束,即质量门禁。这些门禁包括单元测试、属性测试、验收测试、变异测试,以及圈复杂度和行长等代码质量指标,并贯穿 Agent 从解释器到控制器再到生产的全流程。人类注意力应只投向自动化护栏失效时的复杂问题,否则会拖慢机器速度的流程。

7月29日周三
7月28日周二
  1. 宝玉的分享22

    关于 Agent 的几个判断:通用 Agent 通吃、插件生态与模型护城河

    针对 @cellier_ 提出的通用 Agent 吃掉垂直 Agent、开放吃掉封闭、下沉吃掉傲慢三个判断,宝玉补充了自己的六点看法:通用 Agent 赛道本身也会是少数赢家通吃,小通用 Agent 同样没有生存空间;开放与封闭的差别不在开源或模型切换,而在插件生态,Skill 加 MCP 是关键。

7月20日周一
  1. Addy Osmani38

    Addy Osmani:软件工厂的明与暗——从循环、Harness 到无人审查的暗工厂

    Addy Osmani 提出软件工厂由循环、Harness、工厂三层构成:循环是单个 Agent 重复执行任务的最小单元,Harness 是沙箱、工具、记忆与完成判定,工厂则是多个 Harness 化循环共用一个审查门。明工厂保留人类判断,暗工厂让 Agent 自行定范围、构建并发布代码,无人阅读细节。他指出图中生成、测试、扫描几乎零成本,唯一难以扩展的是审查门这一"判断"环节。

7月15日周三
6月19日周五
  1. Steve Yegge32

    Steve Yegge:AI 模型能力曲线为何对大多数人"变平"

    Steve Yegge 提出"平坦曲线社会":模型智能仍在指数增长,但最强大的模型将被各国政府像核武器一样管制,多数企业和开发者只能用到 Fable 级模型。他指出开源模型落后前沿约七个月,且难以突破 Fable 级,因为算力供应链正被锁定。他还提出"辨识地平线"概念,认为用户因缺乏足够难的问题而无法区分更强模型。