我用 Vibe Coding 让 Agent 造出一个能编译 SQLite 的 C 编译器
Jesse Vincent 用 Evener 加 GLM 5.2 以自主 Agent 方式构建了一个 ARM64 C 编译器,约 21 小时后它成功编译 SQLite 并完成一次 INSERT 和 SELECT。
Jesse Vincent 用 Evener 加 GLM 5.2 以自主 Agent 方式构建了一个 ARM64 C 编译器,约 21 小时后它成功编译 SQLite 并完成一次 INSERT 和 SELECT。
JetBrains Air 新增多项目视图,可在同一窗口打开多个项目并并行运行 Agent,侧边栏按项目分组任务,导航单位从窗口变为任务。Markdown 文件现以格式化文本渲染,语法在阅读时隐去、编辑时显现,无需分屏预览。Windows 上的中文、日文、韩文等 IME 问题已修复,该版本还新增首次启动的 Customize 界面和可选择 Agent 与模型的 Agent Review。
本周多款新模型集中发布:GLM-5.3 主打更少输出 token 与网络安全方向,Grok 4.6 已加入 LLM 排行榜并对比 Cursor 与 API 价格,Gemini 3.7 Flash 在 Antigravity 中实测,DeepSeek-v4-Pro 结束预览并公布涨价。
Cursor 发布云 Agent 与 Harness 更新,云 Agent 可订阅 PR、Slack 线程或定时任务等事件源,被触发后自动唤醒并持续推进目标。新增 Custom Modes 可把技能固定在对话中,子 Agent 可运行在各自独立的虚拟机与干净上下文中,用于测试父 Agent 改动或并行修复。还加入 /goal 设定长期目标,以及不打断 Agent 的转向消息机制。
推荐理由:官方更新日志列出云 Agent 订阅事件、子 Agent 独立虚拟机与 /goal 等能力,可据此判断常驻 Agent 的编排方式。
IndyDevDan 发布视频,演示用系统提示词工程把啰嗦的 Claude Opus 5 改造成精确的资深工程师,并称系统提示词比用户提示词和技能更具杠杆。
Addy Osmani 结合自己每天并行运行 5 到 10 个 Agent 的经验,梳理 Claude Code 中 goal 与 loop 两类原语的分工:goal 用可度量的完成条件驱动单个任务迭代,loop 按固定间隔重跑提示词,适合轮询 PR、CI 和日志等场景。
Cursor 为 Cloud Agents 推出 Builds 功能,在后台预先准备好已克隆仓库、已安装依赖并执行过安装脚本的开发环境,智能体启动时直接进入就绪环境,无需每次从零配置。
推荐理由:Cursor 官方给出 Cloud Agents 环境预构建的启动数据与迁移入口,可据此评估现有环境的接入成本。
Zed 团队发布 Delta,一个面向与 Agent 协作编码和评审的多人环境,首批用户已进入私测。Delta 基于自研 DeltaDB,把对话与 worktree 一起实时复制,兼容现有 git 仓库,未使用 Delta 的同事看到的仍是普通 repo。Delta 还支持把线程分享为链接在浏览器打开,并已接入第三方 Agent 运行框架,首个是 Claude Code。
推荐理由:Zed 团队把 DeltaDB 的实时协作能力做成独立应用,读者可据此判断多人加 Agent 的代码评审会怎么变。
NVIDIA Nemotron 3.5 Lightning 已在 Ollama 上线,可完全在本地设备运行。
推荐理由:NVIDIA 开源 30B 总参数、3B 激活的本地 Agent 模型,可对照其吞吐与上下文规格判断本地部署取舍。
Meta Superintelligence Labs 的首个开源模型 Muse Glimmer 已在 Ollama 上线,这是一个 30B 多模态模型,面向本地运行的 Agent 工作负载,上下文长度 128K+,采用 Apache 2.0 许可。
推荐理由:Meta Superintelligence Labs 首个开源模型在 Ollama 上线,可了解其本地编码 Agent 接入方式与 Apple Silicon 加速表现。
Addy Osmani 提出,Agent 每天产生数十万乃至上百万次代码变更,逐行代码审查已不可行,软件质量转而取决于围绕 Agent 设置的约束,即质量门禁。这些门禁包括单元测试、属性测试、验收测试、变异测试,以及圈复杂度和行长等代码质量指标,并贯穿 Agent 从解释器到控制器再到生产的全流程。人类注意力应只投向自动化护栏失效时的复杂问题,否则会拖慢机器速度的流程。
Zed 在 1.14 版本起为所有用户默认启用 Agent 面板沙箱,限制终端和 fetch 工具的行为,由操作系统强制执行而非依赖 Agent 遵守指令。默认规则禁止 Agent 写入项目目录之外、写入 .git 或发起网络请求,需要时 Agent 可申请临时提权并给出理由。
推荐理由:Zed 官方说明沙箱的默认规则、权限升级流程与实现方式,并给出绕过沙箱的若干路径。
一位开发者分享自己使用 Coding Agent 的角色转变:从紧盯代码层的 TL 转为只做方案与验收的 EM,转折点在 Fable 5 前后,他发现 AI 写的代码质量已相当可以,稍加验证就不会有太大偏离。
JetBrains 用 80 组配对任务实测 Claude Code 的 ponytail skill,实测代码量减少 15%、成本降 10.3%、耗时降 11%,约为宣传值(-54% 代码、-22% tokens、-20% 成本、-27% 时间)的四分之一到一半,但这是该系列首个成本节省信号统计上可靠的插件。
针对 @cellier_ 提出的通用 Agent 吃掉垂直 Agent、开放吃掉封闭、下沉吃掉傲慢三个判断,宝玉补充了自己的六点看法:通用 Agent 赛道本身也会是少数赢家通吃,小通用 Agent 同样没有生存空间;开放与封闭的差别不在开源或模型切换,而在插件生态,Skill 加 MCP 是关键。
JetBrains Air 发布新版本,通过 JetBrains 与 Zed 开发的 Agent Client Protocol(ACP)支持 GitHub Copilot、OpenCode、Pi、Cline 等兼容 ACP 的编码 Agent,不再局限于内置的 Claude、Codex、Gemini CLI 和 Junie。
推荐理由:Air 通过 ACP 接入外部编码 Agent 与本地模型,读者可据此判断多 Agent 工作流的接入方式。
JetBrains 发布 JetBrains Context,一个面向编码 Agent 的仓库智能层,现已随 JetBrains AI 订阅开放早期访问且不额外收费、不消耗配额。
推荐理由:JetBrains 官方给出仓库智能层的接入方式与三项基准降幅,可据此判断编码 Agent 在大型代码库中的成本变化。
Addy Osmani 提出软件工厂由循环、Harness、工厂三层构成:循环是单个 Agent 重复执行任务的最小单元,Harness 是沙箱、工具、记忆与完成判定,工厂则是多个 Harness 化循环共用一个审查门。明工厂保留人类判断,暗工厂让 Agent 自行定范围、构建并发布代码,无人阅读细节。他指出图中生成、测试、扫描几乎零成本,唯一难以扩展的是审查门这一"判断"环节。
Addy Osmani 在 AI Engineer World's Fair 2026 闭幕演讲中提出,工程师必须掌控智能体工程的"外循环",即对系统负责。他将智能体定义为模型加 Harness,循环为调查、实现、验证、重复,工厂则是规模化运行的循环。
Ollama 0.31 让 Gemma 4 在 Apple Silicon 上生成 token 平均提速近 90%,该加速默认开启且不改变模型输出。提速来自多 token 预测(MTP):Gemma 4 附带一个小型草稿模型,先提出后续若干 token,主模型一次验证并保留一致的部分,代码场景因可预测性高而受益明显。
推荐理由:原文给出 MTP 加速的实测数据与实现细节,读者可据此判断本地编码 Agent 的响应速度变化。
Steve Yegge 认为技术面试已走到尽头,他基于近 35 年面试官经历指出,Google 的统计显示面试官之间几乎无法达成一致,同一候选人常被一人评为"强烈推荐"、被另一人直接拒绝,且面试分数与入职后表现几乎无关。他曾在 Amazon 担任 Bar Raiser、在 Google 任职 Hiring Committee,认为现有流程靠各种"创可贴"式修补维持,却仍大量误招与错拒。
Steve Yegge 推出 Wasteland,一个把上千个 Gas Town 连接成信任网络、以共享 Wanted Board 接活与盖章的联邦式协作系统,核心机制沿用 Git 的 fork/merge、push/pull 模型。
Steve Yegge 提出"AI 吸血鬼"概念,认为 AI 确实能带来 10 倍生产力,但价值捕获机制决定了开发者要么被公司榨干、要么公司被竞争对手淘汰。他以 Opus 4.5/4.6 配合 Claude Code 为例,称 AI 编程在 2025 年 11 月 24 日到达事件视界,并提到 Claude Code 已在微软工程团队中迅速占据主导。