Agent Skills 是供应链组件:一次关于技能安全模型的演讲
Liran Tal 在 AI Native DevCon London 的演讲中指出,Agent Skills 不只是给人类看的 markdown,一旦被 Agent 信任就能影响其读取内容、调用工具和访问工作区,因此应被视为供应链组件。
Liran Tal 在 AI Native DevCon London 的演讲中指出,Agent Skills 不只是给人类看的 markdown,一旦被 Agent 信任就能影响其读取内容、调用工具和访问工作区,因此应被视为供应链组件。
GitHub Next 的 Don Syme 提出在 CI 和 CD 之外增加第三根支柱 Continuous AI,即由仓库事件或定时触发的自动化 AI 工作流,用于持续文档、代码改进、问题分诊和故障分析。
《Building Microservices》作者 Sam Newman 在新书《Building Resilient Distributed Systems》中提出分布式系统三法则:信息传输需要时间、资源可能离线、资源并非无限,并指出多数故障源于资源耗尽。
The Pragmatic Engineer 在 LDX3 工程领导力大会的主题演讲给出 2026 年科技行业快照:几乎没人再手写代码,同时运行 5-10 个 Agent 已成常态,IDE 正在淡化。
Martin Fowler 在最新 Fragments 中提出,构建确定性软件与"养育"推理型 LLM 是两回事:前者发现 bug 通常能修复或禁用组件,而 LLM 没有这种简单修复或停用手段。
OpenAI 研究员 Noam Brown 在与 Dwarkesh Patel 的对话中表示,多智能体系统的收益有限,1 万个 Agent 解出世界级难题时多 Agent 的贡献不到 10%。他认为推理时计算比单纯增加 Agent 数量更具突破潜力,并指出 AI 写代码快并不等同于交付快,瓶颈已从编码转移到上下文管理与协作。他还谈到递归自我改进不会一夜爆发,因为许多科学实验必须串行进行。
Cockroach Labs 联合创始人兼 CTO、GIMP 原始作者 Peter Mattis 在 The Pragmatic Engineer 播客中回顾了从开源到 Google 再到创办数据库公司的历程。
针对“软件工程正进入人机半人马时代”的观点,Sean Goedecke 认为 AI 辅助的工程师虽然比 AI 和人类单独都强,但并非在编程本身上更强。AI 写的代码能编译、少有并发错误,问题在于不可维护、为满足虚构需求牺牲重要需求等“品味”问题,因此人类的核心价值是让 AI 对齐组织价值观。前沿模型对工作程序员存在错位,如堆砌大段注释和无用单元测试,而对齐比能力更难解决且更依赖上下文。
Martin Fowler 在 9 月 24 日的碎片集中回应 Rob Bowley 的观点:真正该担心的不是未来 AI 灭绝人类,而是当下 AI 被轻率快速地接入一切,智能体部署中常出现 Lethal Trifecta 安全漏洞。
作者在 24 个编程提示词上实测 Opus 5.5,在 144 个提示词上实测 GPT-6-Sol 与 GPT-6-Luna,并单独测试 Grok 4.7 的编程表现。
GitHub Next staff research engineer Maggie Appleton 在 Pragmatic Engineer 播客中分享设计工程实践:她用手绘笔记本草图启动项目,因为比向 Claude Code 描述更快,且次日仍可回溯。
GitHub Podcast 最新一期拆解了五个 AI 热门论断:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决的是不同问题,前者是可读的打包经验,后者是连接工具与数据的标准接口,二者可组合使用。
Armin Ronacher 用 Opus 5 按 David Sacks 推文的结构生成了一段 8 段、350 词以内的文本,Pangram 判定其为 100% AI 生成。随后他逐段人工改写,与原文相似度约 50%、无一句相同,仅用 LLM 修正错别字。Pangram 自称误判人类文本为 AI 的比例为 0.0041%,漏检 AI 文本为 0.34%。
Armin Ronacher 用 GPT 6 Astra 跑了一个周末的无人值守软件工厂,35 小时产出 75k 行代码、79 个 commit、约 1B tokens(约 1200 美元 API 成本),但没有交付任何有价值的东西。
Armin Ronacher 想给廉价 CarPlay 车机棒刷第三方固件,通过 Pi 与 LLM 对话得知了用 Rust 重写 CarPlay 协议的 CatPlay,并让 Kimi K3 和 Sol 帮忙搞定刷机与为对应 SoC 编译。
Zed 认为 Ted Nelson 的 Xanadu 超文本构想之所以长期无法落地,是因为缺少能耐心追踪每一层引用的用户,而 AI 智能体正好补上这一环。DeltaDB 用 Lamport 时间戳、Merkle 树、CRDT、廉价存储、常连网络和 Firecracker 级微虚拟机等六十年积累的组件,实现"永不复制、只引用,永不覆盖、只版本化"的 xanalogical 计算。
IndyDevDan 提出 Agentic Engineering Operating Level 框架,把工程师和 Agent 可操作的层级分为五级:Code Primitives、Code Structure、Data and Execution、Delivery and Intent、Agentic Systems。
Addy Osmani 提出"Agentic Skill Decay"概念,指出 AI 智能体虽能跳过大量编码实践,但工程师的品味与判断力仍来自亲手做"reps"。
Steve Yegge 每月花费约 12.2 万美元 API token(约每天 4000 美元),使用 21 个 Claude Max 账号,并以每周 2 个的速度增长,用于开发他做了 30 年的游戏 Wyvern。
Addy Osmani 认为软件工厂是围绕软件工作的可重复循环,但可交付的代码仍需人类品味与所有权,人类应前置决定产品意图、系统设计和质量标准。他指出用 Claude Code 或 Codex 配合多会话、带验证的 SPEC 和约束就能走很远,只有当系统需要可重复、事件驱动时才值得建工厂。
Addy Osmani 提出,Agent 每天产生数十万乃至上百万次代码变更,逐行代码审查已不可行,软件质量转而取决于围绕 Agent 设置的约束,即质量门禁。这些门禁包括单元测试、属性测试、验收测试、变异测试,以及圈复杂度和行长等代码质量指标,并贯穿 Agent 从解释器到控制器再到生产的全流程。人类注意力应只投向自动化护栏失效时的复杂问题,否则会拖慢机器速度的流程。
针对 @cellier_ 提出的通用 Agent 吃掉垂直 Agent、开放吃掉封闭、下沉吃掉傲慢三个判断,宝玉补充了自己的六点看法:通用 Agent 赛道本身也会是少数赢家通吃,小通用 Agent 同样没有生存空间;开放与封闭的差别不在开源或模型切换,而在插件生态,Skill 加 MCP 是关键。
Addy Osmani 提出软件工厂由循环、Harness、工厂三层构成:循环是单个 Agent 重复执行任务的最小单元,Harness 是沙箱、工具、记忆与完成判定,工厂则是多个 Harness 化循环共用一个审查门。明工厂保留人类判断,暗工厂让 Agent 自行定范围、构建并发布代码,无人阅读细节。他指出图中生成、测试、扫描几乎零成本,唯一难以扩展的是审查门这一"判断"环节。
Addy Osmani 在 AI Engineer World's Fair 2026 闭幕演讲中提出,工程师必须掌控智能体工程的"外循环",即对系统负责。他将智能体定义为模型加 Harness,循环为调查、实现、验证、重复,工厂则是规模化运行的循环。
Steve Yegge 提出"平坦曲线社会":模型智能仍在指数增长,但最强大的模型将被各国政府像核武器一样管制,多数企业和开发者只能用到 Fable 级模型。他指出开源模型落后前沿约七个月,且难以突破 Fable 级,因为算力供应链正被锁定。他还提出"辨识地平线"概念,认为用户因缺乏足够难的问题而无法区分更强模型。