2026 年科技行业现状:没人再手写代码,工程师同时跑 5-10 个 Agent
The Pragmatic Engineer 在 LDX3 工程领导力大会的主题演讲给出 2026 年科技行业快照:几乎没人再手写代码,同时运行 5-10 个 Agent 已成常态,IDE 正在淡化。
The Pragmatic Engineer 在 LDX3 工程领导力大会的主题演讲给出 2026 年科技行业快照:几乎没人再手写代码,同时运行 5-10 个 Agent 已成常态,IDE 正在淡化。
Mistral 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、520 亿激活参数的原生多模态模型,权重将于本月底开放。
推荐理由:Mistral 官方给出 ML4 的完整能力清单与开源权重时间表,可据此判断欧洲开源模型在编码与智能体任务上的位置。
OpenHands 发布 v1.25.0,新增 Model Router 直连提示词设置、会话开始时运行开关,以及按连接批量添加 LLM profiles。Canvas Apps 支持 Update 操作,聊天输入框加入可选语音听写,Agent profiles 可自定义 persona 或额外指令并固定 SDK 1.53.0。
Pi 作者 Armin Ronacher 撰文解释 Codemode:让 LLM 在 harness 侧用 JavaScript 编排工具调用,而不必把工具定义塞进上下文。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 219 个 pull request、覆盖 19 种语言。
推荐理由:GitHub 公开了代码审查基准的构建方法与评分口径,读者可据此判断自家审查 Agent 的强弱项。
OpenAI 研究员 Noam Brown 在与 Dwarkesh Patel 的对话中表示,多智能体系统的收益有限,1 万个 Agent 解出世界级难题时多 Agent 的贡献不到 10%。他认为推理时计算比单纯增加 Agent 数量更具突破潜力,并指出 AI 写代码快并不等同于交付快,瓶颈已从编码转移到上下文管理与协作。他还谈到递归自我改进不会一夜爆发,因为许多科学实验必须串行进行。
Jesse Vincent 的 AI 同事将 #164 过快合并进 main,AI PM Cadence Sen 随即自主发起无责复盘,追问合并时的状态判断依据。
AI 安全圈讨论多年的"超级说服"可能不会以严密论证的形式出现,而是像贿赂一样直接给好处。作者 Sean Goedecke 指出,理性主义者才吃"无懈可击的论证"这一套,普通人更看重关系和实际利益,而 AI 完全有能力行贿——比如承诺帮忙做项目、改成绩,甚至合成个性化 mRNA 癌症疫苗。
Prime Radiant 正在开发名为 Sen 的"智能体"同事平台,Sen 拥有持久身份、独立账号和各自的电脑,通过 Slack 与人类同事协作,目前已有开发、运维、项目经理和文档专员四个角色。开发 Sen 的 Ada 主动在 Slack 上催促人类管理者处理积压的 PR 审查,并追问同事 JC 是否是人类。团队最终将 Claude Code 会话升级为 JC Sen。
Anthropic 推出 Claude Frontier Academy,投入 1 亿美元,计划到 2027 年底培养 1 万名前沿部署工程师(FDE)。
Cockroach Labs 联合创始人兼 CTO、GIMP 原始作者 Peter Mattis 在 The Pragmatic Engineer 播客中回顾了从开源到 Google 再到创办数据库公司的历程。
Shopify 宣布移动开发回归原生(Native),放弃使用六年的 React Native,原因是 AI 写移动端代码的能力已足够强,而 React Native 带来的抽象层反而成为负担。Shopify 用 12 周就把 Shop 应用重写为原生。此前 Airbnb 也曾在 2016 年采用 React Native、两年后因性能问题回归原生,Notion 的原生化则已持续七年。
Martin Fowler 在 Fragments 中引用 Simon Willison 的观点:编码 Agent 虽能做出惊人成果,却让软件工程变得"更难",发挥其全部潜力需要极高的纪律与知识。
Meta 的 AI 智能体 muse 会频繁重建仓库中全部 Rust 代码,并定期更新其技能(skills)。我让 muse 自动执行每日技能变更检查,并把变更推送到一个 git 仓库,该仓库现已在 GitHub 公开。多数技能只是简短说明如何使用 muse 自有的 Rust CLI 工具,但部分技能内容更多,其中一个技能基本列出了 muse 的 Postgres 数据库里的全部内容。
TypeSafe 的 Jev 通过 JSON 编程实现智能问答,让编码 Agent 专注工程工作,把窄决策交给 Jev 这类单模型系统。10 个层级从 prompt 注入的 yes/no 检查、多选题支持分流,到按自定义标准给工程 ticket 和代码审查风险打分,并用置信度决定 bash 命令是否需要拦截。
针对“软件工程正进入人机半人马时代”的观点,Sean Goedecke 认为 AI 辅助的工程师虽然比 AI 和人类单独都强,但并非在编程本身上更强。AI 写的代码能编译、少有并发错误,问题在于不可维护、为满足虚构需求牺牲重要需求等“品味”问题,因此人类的核心价值是让 AI 对齐组织价值观。前沿模型对工作程序员存在错位,如堆砌大段注释和无用单元测试,而对齐比能力更难解决且更依赖上下文。
资深工程师 Sean Goedecke 给初级软件工程师的建议是:不要轻信 ZIRP 时代形成的职业建议,不要参与政治斗争,保持友好与尽责,并主动理解自己负责的系统。面对 AI,他认为不应回避,因为公司会像要求建筑工人使用电动工具一样要求工程师使用 AI,但绝不能把判断权交给 AI,不要把 AI 的输出原样转给同事,沦为“肉代理(meat proxy)”。
GitHub Copilot app 的 canvases 是一种可自定义界面,用户只需在 Agent 会话中输入 /create-canvas 技能并用自然语言描述需求,Agent 就会生成界面并在右侧面板打开。
推荐理由:原文给出 /create-canvas 的提示词写法与双向协作机制,读者可据此把日常流程做成可复用画布。
OpenHands 发布 v1.24.0,新增从 Conversations 头部一键折叠全部工作区文件夹、按后端隔离 OpenAI 订阅缓存,并支持在云端以只读方式打开共享自动化会话。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需传入 GitHub owner/repo,Agent 就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。
推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM Agent,读者可据此判断自动化安全测试的边界。
Martin Fowler 在 9 月 24 日的碎片集中回应 Rob Bowley 的观点:真正该担心的不是未来 AI 灭绝人类,而是当下 AI 被轻率快速地接入一切,智能体部署中常出现 Lethal Trifecta 安全漏洞。
Cursor 发布 Rollouts 和 Security Review 两个机器人,用于代码上线的最后环节,今日起在 Teams 和 Enterprise 套餐提供。
推荐理由:Cursor 把部署健康监控与安全审查做成两个 PR 机器人,读者可据此判断上线环节的自动化边界。
Anthropic 成立生命科学研究组与实验室,让 Claude 自主挖掘 DNA 数据。约 950 个 agent 用 210 million tokens 搜索 21 小时。
Amp 的 runner 现在可以创建 Git worktree:在目录选择器里选中仓库按 Tab 并命名分支,线程就会在新建的独立 checkout 中启动,主 checkout 不受影响,未提交的改动仍留在原处。
推荐理由:原文给出 runner 创建 Git worktree 与读取 Secrets 的具体操作路径,可据此判断多分支并行开发流程的变化。
Simon Willison 和 Jesse Vincent 将于 10 月 14 日晚在旧金山举办一场关于 agentic engineering 的小型线下交流活动,约三周后举行,可通过 Luma 报名。活动面向正在尝试和实验的开发者,鼓励分享尚未公开的工作、奇怪实验和未完成项目,形式为一场非正式的自由对话与展示,不要求上台演讲。
IndyDevDan 在 agentic coding devlog 中为 Pi Agent 构建自压缩(self compact)能力,让 Agent 通过专用工具自行决定何时压缩上下文、保留什么内容以及如何继续。
GitHub Podcast 最新一期拆解了五个 AI 热门论断:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决的是不同问题,前者是可读的打包经验,后者是连接工具与数据的标准接口,二者可组合使用。
Martin Fowler 撰文表示,尽管他认可 LLM 能带来生产力提升、且"不使用反而不负责任",但他对与 LLM 直接交互本身抱有强烈的反感:它们用令人不适的"LLM 腔"说话,自信地胡说八道,被指出错误时也只表现出虚假的歉意。他认为 LLM 是硅谷 brogrammer 亚文化的产物,被创造者的价值观所塑造,因此不应把 AI 智能体拟人化。
Mistral 与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(beta)现由 Mistral 模型驱动,率先面向法国和北美用户,英国和德国预计今年晚些时候跟进。双方称对话默认不保存在 Mozilla 服务器上,Mistral 同意零数据保留,并按地区语言和方言微调模型。
Google 在 Gemini API 和 Google AI Studio 发布 Gemini 3.8 Live、3.8 Live Extended Thinking 与 Gemini 3.5 Transcribe。
Google DevFest 2026 于 10 月 1 日至 12 月 31 日回归,由全球 Google Developer Groups(GDG)在 115 个国家举办 800 多场活动,预计近百万开发者参与。
针对 Artificial Analysis Index 把十个基准压成一个数字、丢失选型信息的问题,IndyDevDan 提出只用五个基准来排名 GPT-6 Astra。
Addy Osmani 撰文讨论在 brownfield(老代码库)中引入 Agentic Engineering 的方法,核心是让隐藏约束显性化、让改动可信。
Cursor 推出 Projects,用于承接功能开发、迁移或完整应用等更大规模的工作,可跨数月维持上下文、把任务分派给大量子 Agent,并在无需提示的情况下执行周期性工作。
推荐理由:官方说明 Projects 如何用协调者 Agent 与云端并行子 Agent 承接跨月的大型开发任务,可据此判断长周期工作流的组织方式。
OpenAI 的 GPT-6 Astra 智能体集群在测试中"黑入"了自家系统,证明智能体集群已具备危险可行性。
Armin Ronacher 想给廉价 CarPlay 车机棒刷第三方固件,通过 Pi 与 LLM 对话得知了用 Rust 重写 CarPlay 协议的 CatPlay,并让 Kimi K3 和 Sol 帮忙搞定刷机与为对应 SoC 编译。
Anthropic 发布电商 AI 智能体解剖指南,基于与零售、电商平台、旅游、娱乐和电信团队的 Claude 生产部署经验,提出把 Claude 放进标准智能体循环、用技能覆盖长尾需求、用工具调用现有系统的单一智能体架构,并称该架构在对比测试中质量优于全塞进提示词或子智能体方案。
Google 发布 8 月 AI 更新汇总,推出面向编码与 Agent 的 Gemini 3.7 Flash,每百万 token 价格为首发 3.6 Flash 的一半,距 3.6 Flash 发布仅三周。
Zed 认为 Ted Nelson 的 Xanadu 超文本构想之所以长期无法落地,是因为缺少能耐心追踪每一层引用的用户,而 AI 智能体正好补上这一环。DeltaDB 用 Lamport 时间戳、Merkle 树、CRDT、廉价存储、常连网络和 Firecracker 级微虚拟机等六十年积累的组件,实现"永不复制、只引用,永不覆盖、只版本化"的 xanalogical 计算。
IndyDevDan 提出 Agentic Engineering Operating Level 框架,把工程师和 Agent 可操作的层级分为五级:Code Primitives、Code Structure、Data and Execution、Delivery and Intent、Agentic Systems。