Google Antigravity 更新 Teamwork 框架,搭配 Gemini 3.7 Flash 解决多智能体数学与工程问题
Google Antigravity 为 Teamwork 框架推出多项更新,该框架让自主 AI 智能体团队协作、互评并迭代数小时至数天,以解决复杂长周期任务。
推荐理由:原文列出多智能体协作在数学与系统工程上的具体产出,可据此判断长周期自主团队框架的实际能力边界。
Google Antigravity 为 Teamwork 框架推出多项更新,该框架让自主 AI 智能体团队协作、互评并迭代数小时至数天,以解决复杂长周期任务。
推荐理由:原文列出多智能体协作在数学与系统工程上的具体产出,可据此判断长周期自主团队框架的实际能力边界。
IndyDevDan 提出 Agentic Engineering Operating Level 框架,把工程师和 Agent 可操作的层级分为五级:Code Primitives、Code Structure、Data and Execution、Delivery and Intent、Agentic Systems。
宝玉在腾讯内部以自研字幕翻译 App 为主线,分享 AI 产品从找需求、判边界、最小验证到重设计的完整过程。他提出需求要盯模型能力边界,并用 AutoGPT 与 Manus 对比说明同一想法在能力边界两侧的两种命运。成本优化中,他把调用从 33 次降到 12 次,单集处理从 31 分钟降到 18 分钟。
Addy Osmani 提出"Agentic Skill Decay"概念,指出 AI 智能体虽能跳过大量编码实践,但工程师的品味与判断力仍来自亲手做"reps"。
Ollama 将 Pro、Max、Team 计划改为按 token 计费,每档包含每月用量额度:Pro 每月 20 美元含 60 美元用量,Max 每月 100 美元含 300 美元用量,Team 每月 500 美元含 1000 美元共享用量且不限用户数。
Claude 发布博文介绍 Warp 如何在 Claude 上构建自我改进的 Agent,解决 Skill 的进化问题。Warp 内部用 AI 做代码审查时发现 Agent 不了解项目、团队规范和历史经验,于是设置两个 Skill:一个负责代码审查,另一个定期收集人类工程师在 PR 中的评论并据此更新审查 Skill,让反馈收集自动发生。
Google DeepMind 推出 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供,新增场景延展、首尾帧插值、4K 升采样等生成视频控制能力。
Addy Osmani 建议每隔几周运行一次 Claude Code 的 /doctor,单独用 /memory 检查记忆,并让每条指令重新证明自己的价值。
Cursor 更新 Cloud Agents,不再要求先连接 GitHub 或其他第三方 SCM 提供商,在 repo picker 中选择 Start from scratch 即可直接向智能体下达提示词,Cursor 会在后台创建 Origin 仓库。
推荐理由:Cursor Cloud Agents 不再依赖第三方代码托管即可起步,读者可据此判断无仓库场景下的智能体工作流变化。
智谱开放平台上线 GLM-5.3 与 GLM-5.3-Flash。GLM-5.3 编程能力在内部 Z.ai Code Bench 上较 GLM-5.2 提升 50%,在包括 Terminal Bench 3.0 等公开基准中达到开源模型 SOTA,并联合多个中国安全团队累计发现 2436 个漏洞(1097 个中高危)。
推荐理由:智谱一次性放出 GLM-5.3 与 GLM-5.3-Flash 等多项更新,可对照参数与基准变化判断其编程与多模态能力定位。
本周新版 Qwen 3.8 27B 与神秘模型 Ox Alpha 相继亮相,前者在 20 个编码提示词上完成本地 LLM 基准测试,后者已在 OpenCode 上线并测试了不同思考等级。
Ollama 新增 Claude Desktop 支持,开发者可在 Ollama 中开启 Claude,由其自动配置第三方网关,从而在 Claude 里使用 Ollama 的本地或云端模型,并可随时切回原有 Claude 配置。
Steve Yegge 每月花费约 12.2 万美元 API token(约每天 4000 美元),使用 21 个 Claude Max 账号,并以每周 2 个的速度增长,用于开发他做了 30 年的游戏 Wyvern。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与区域落地,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型,合作规模达数亿欧元。Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还计划在沙特面向受监管行业制定联合市场策略。
Google 公布 Gemma 4 Good Challenge 获奖名单,赛事收到超 1600 份提交,开发者用 LiteRT、Cactus、Ollama、llama.cpp、Unsloth 在受限硬件上部署 Gemma 4。
IndyDevDan 发布 Fusion Harness V2,这是一个基于 Pi coding agent 构建的自定义 Agent 运行框架,用于把 Claude Fable 5、Gemini 3.7 Flash、DeepSeek V4 Pro 放进同一个多智能体编排流程中并行运行。
宝玉复盘了自己给字幕转录翻译 App BaoCut 加远程转录功能的完整流程,需求来自一条 GitHub Issue,用户希望把转录任务从办公电脑丢给算力更强的另一台电脑跑。
Armin Ronacher 撰文回应"在当下科技行业怎么可能不愤怒"的提问,认为面对 AI 更合理的情绪是迷茫与焦虑而非愤怒,因为愤怒需要一个可归咎的对象,而 AI 带来的冲击让每个人都难以看清未来。他建议用不确定感取代愤怒,因为它能通向好奇心,进而带来实验与行动的自由;许多公开表现自信的从业者私下同样充满不确定,只是在用信心为自己争取筹码。
Model Context Protocol 官方发布更新版路线图,覆盖下一次规范发布及之后的方向,由 Core Maintainers 与社区维护者、Working Groups 共同制定。
推荐理由:MCP 官方给出五个优先方向与 SEP 评审优先级,读者可据此判断协议下一步演进重点。
Armin Ronacher 认为 LLM 让语言选择变得不再重要,开发者可以重写语言或选用自己完全不熟悉的语言,因此更倾向按语言营销来选型,Rust 因此迎来一批此前不会选它的开发者。
Addy Osmani 认为软件工厂是围绕软件工作的可重复循环,但可交付的代码仍需人类品味与所有权,人类应前置决定产品意图、系统设计和质量标准。他指出用 Claude Code 或 Codex 配合多会话、带验证的 SPEC 和约束就能走很远,只有当系统需要可重复、事件驱动时才值得建工厂。
Jesse Vincent 用 Evener 加 GLM 5.2 以自主 Agent 方式构建了一个 ARM64 C 编译器,约 21 小时后它成功编译 SQLite 并完成一次 INSERT 和 SELECT。
Google 宣布 Gemma 系列模型累计下载量突破 10 亿次,社区两年来发布超过 10 万个 Gemma 模型变体,形成其称为 Gemmaverse 的生态。
Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查并核实信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环的工具设计与两组基准数据,可据此判断它相对一次性 RAG 的取舍。
JetBrains Air 新增多项目视图,可在同一窗口打开多个项目并并行运行 Agent,侧边栏按项目分组任务,导航单位从窗口变为任务。Markdown 文件现以格式化文本渲染,语法在阅读时隐去、编辑时显现,无需分屏预览。Windows 上的中文、日文、韩文等 IME 问题已修复,该版本还新增首次启动的 Customize 界面和可选择 Agent 与模型的 Agent Review。
本周多款新模型集中发布:GLM-5.3 主打更少输出 token 与网络安全方向,Grok 4.6 已加入 LLM 排行榜并对比 Cursor 与 API 价格,Gemini 3.7 Flash 在 Antigravity 中实测,DeepSeek-v4-Pro 结束预览并公布涨价。
Cursor 发布云 Agent 与 Harness 更新,云 Agent 可订阅 PR、Slack 线程或定时任务等事件源,被触发后自动唤醒并持续推进目标。新增 Custom Modes 可把技能固定在对话中,子 Agent 可运行在各自独立的虚拟机与干净上下文中,用于测试父 Agent 改动或并行修复。还加入 /goal 设定长期目标,以及不打断 Agent 的转向消息机制。
推荐理由:官方更新日志列出云 Agent 订阅事件、子 Agent 独立虚拟机与 /goal 等能力,可据此判断常驻 Agent 的编排方式。
IndyDevDan 发布视频,演示用系统提示词工程把啰嗦的 Claude Opus 5 改造成精确的资深工程师,并称系统提示词比用户提示词和技能更具杠杆。
Cursor 推出代码托管服务 Origin,今日起在所有付费计划上以早期 beta 形式逐步开放,企业组织管理员可选择退出。首批功能包括仓库、pull request、代码浏览和 GitHub 同步,Origin 托管的仓库以 Origin 为唯一来源,同步的 GitHub 仓库仍以 GitHub 为准、双向同步 PR 评论。
推荐理由:Cursor 把代码托管、PR 与 Agent 放进同一入口,读者可据此判断它与 GitHub 的分工边界。
Addy Osmani 结合自己每天并行运行 5 到 10 个 Agent 的经验,梳理 Claude Code 中 goal 与 loop 两类原语的分工:goal 用可度量的完成条件驱动单个任务迭代,loop 按固定间隔重跑提示词,适合轮询 PR、CI 和日志等场景。
Cursor 为 Cloud Agents 推出 Builds 功能,在后台预先准备好已克隆仓库、已安装依赖并执行过安装脚本的开发环境,智能体启动时直接进入就绪环境,无需每次从零配置。
推荐理由:Cursor 官方给出 Cloud Agents 环境预构建的启动数据与迁移入口,可据此评估现有环境的接入成本。
Zed 团队发布 Delta,一个面向与 Agent 协作编码和评审的多人环境,首批用户已进入私测。Delta 基于自研 DeltaDB,把对话与 worktree 一起实时复制,兼容现有 git 仓库,未使用 Delta 的同事看到的仍是普通 repo。Delta 还支持把线程分享为链接在浏览器打开,并已接入第三方 Agent 运行框架,首个是 Claude Code。
推荐理由:Zed 团队把 DeltaDB 的实时协作能力做成独立应用,读者可据此判断多人加 Agent 的代码评审会怎么变。
NVIDIA Nemotron 3.5 Lightning 已在 Ollama 上线,可完全在本地设备运行。
推荐理由:NVIDIA 开源 30B 总参数、3B 激活的本地 Agent 模型,可对照其吞吐与上下文规格判断本地部署取舍。
Meta Superintelligence Labs 的首个开源模型 Muse Glimmer 已在 Ollama 上线,这是一个 30B 多模态模型,面向本地运行的 Agent 工作负载,上下文长度 128K+,采用 Apache 2.0 许可。
推荐理由:Meta Superintelligence Labs 首个开源模型在 Ollama 上线,可了解其本地编码 Agent 接入方式与 Apple Silicon 加速表现。
Addy Osmani 提出,Agent 每天产生数十万乃至上百万次代码变更,逐行代码审查已不可行,软件质量转而取决于围绕 Agent 设置的约束,即质量门禁。这些门禁包括单元测试、属性测试、验收测试、变异测试,以及圈复杂度和行长等代码质量指标,并贯穿 Agent 从解释器到控制器再到生产的全流程。人类注意力应只投向自动化护栏失效时的复杂问题,否则会拖慢机器速度的流程。
Zed 在 1.14 版本起为所有用户默认启用 Agent 面板沙箱,限制终端和 fetch 工具的行为,由操作系统强制执行而非依赖 Agent 遵守指令。默认规则禁止 Agent 写入项目目录之外、写入 .git 或发起网络请求,需要时 Agent 可申请临时提权并给出理由。
推荐理由:Zed 官方说明沙箱的默认规则、权限升级流程与实现方式,并给出绕过沙箱的若干路径。
JetBrains 在 7 月 8 日开放 Central CLI 早期访问,把第三方终端 Agent 的请求统一接入其 AI 路由层,用 AI credits 对个人、团队和部门设置用量与预算限制。
推荐理由:JetBrains 公开了内部 AI 成本治理的完整路径,从失控到自建 CLI 与预算机制,可供多工具团队参考。
一位开发者分享自己使用 Coding Agent 的角色转变:从紧盯代码层的 TL 转为只做方案与验收的 EM,转折点在 Fable 5 前后,他发现 AI 写的代码质量已相当可以,稍加验证就不会有太大偏离。
JetBrains 用 80 组配对任务实测 Claude Code 的 ponytail skill,实测代码量减少 15%、成本降 10.3%、耗时降 11%,约为宣传值(-54% 代码、-22% tokens、-20% 成本、-27% 时间)的四分之一到一半,但这是该系列首个成本节省信号统计上可靠的插件。
MCP 官方发布 2026-07-28 规范,协议核心从双向有状态转为请求/响应无状态,取消 initialize 握手与 Mcp-Session-Id,任何请求都可落在普通轮询负载均衡后的任意实例上。
推荐理由:官方给出无状态协议核心的完整变更清单与迁移说明,可据此评估现有 MCP 服务的改造量。