GPT-6 Astra、Fable 5.1 等多款新 LLM 集中发布
多款新 LLM 密集亮相:GPT-6 Astra 已进入 ChatGPT 应用,Tibo 称其在 low 档推理下表现优于 GPT-5.6 Sol 的 high 档,并因需求空前可能暂停新的 Pro 订阅。同期被测试的还有 Fable 5.1、Omen Alpha、Muse Spark 1.3、Gemini-3.8-Flash 和 Qwen 3.8 Max 0902 版本。
多款新 LLM 密集亮相:GPT-6 Astra 已进入 ChatGPT 应用,Tibo 称其在 low 档推理下表现优于 GPT-5.6 Sol 的 high 档,并因需求空前可能暂停新的 Pro 订阅。同期被测试的还有 Fable 5.1、Omen Alpha、Muse Spark 1.3、Gemini-3.8-Flash 和 Qwen 3.8 Max 0902 版本。
作者用 29 个 LLM 测试代码质量并更新了排行榜,新增 GLM-5.3-Flash(原 Ox Alpha)在 21 个编码提示词上的测试,以及 Qwen 3.8-Flash 在 20 个提示词上的测试。
Anthropic 发布电商 AI 智能体解剖指南,基于与零售、电商平台、旅游、娱乐和电信团队的 Claude 生产部署经验,提出把 Claude 放进标准智能体循环、用技能覆盖长尾需求、用工具调用现有系统的单一智能体架构,并称该架构在对比测试中质量优于全塞进提示词或子智能体方案。
Claude 发布博文介绍 Warp 如何在 Claude 上构建自我改进的 Agent,解决 Skill 的进化问题。Warp 内部用 AI 做代码审查时发现 Agent 不了解项目、团队规范和历史经验,于是设置两个 Skill:一个负责代码审查,另一个定期收集人类工程师在 PR 中的评论并据此更新审查 Skill,让反馈收集自动发生。
Addy Osmani 建议每隔几周运行一次 Claude Code 的 /doctor,单独用 /memory 检查记忆,并让每条指令重新证明自己的价值。
本周新版 Qwen 3.8 27B 与神秘模型 Ox Alpha 相继亮相,前者在 20 个编码提示词上完成本地 LLM 基准测试,后者已在 OpenCode 上线并测试了不同思考等级。
Ollama 新增 Claude Desktop 支持,开发者可在 Ollama 中开启 Claude,由其自动配置第三方网关,从而在 Claude 里使用 Ollama 的本地或云端模型,并可随时切回原有 Claude 配置。
Steve Yegge 每月花费约 12.2 万美元 API token(约每天 4000 美元),使用 21 个 Claude Max 账号,并以每周 2 个的速度增长,用于开发他做了 30 年的游戏 Wyvern。
宝玉复盘了自己给字幕转录翻译 App BaoCut 加远程转录功能的完整流程,需求来自一条 GitHub Issue,用户希望把转录任务从办公电脑丢给算力更强的另一台电脑跑。
IndyDevDan 发布视频,演示用系统提示词工程把啰嗦的 Claude Opus 5 改造成精确的资深工程师,并称系统提示词比用户提示词和技能更具杠杆。
JetBrains 用 80 组配对任务实测 Claude Code 的 ponytail skill,实测代码量减少 15%、成本降 10.3%、耗时降 11%,约为宣传值(-54% 代码、-22% tokens、-20% 成本、-27% 时间)的四分之一到一半,但这是该系列首个成本节省信号统计上可靠的插件。
MCP 官方发布 2026-07-28 规范,协议核心从双向有状态转为请求/响应无状态,取消 initialize 握手与 Mcp-Session-Id,任何请求都可落在普通轮询负载均衡后的任意实例上。
推荐理由:官方给出无状态协议核心的完整变更清单与迁移说明,可据此评估现有 MCP 服务的改造量。
MCP 的 Enterprise-Managed Authorization(EMA)扩展现已稳定,组织可通过其身份提供商集中管理 MCP 服务器授权,用户首次登录即可自动连接所需服务器,无需逐个应用 OAuth。
推荐理由:MCP 官方发布企业级授权扩展,读者可了解其 ID-JAG 流程与已接入的客户端和服务器生态。
MCP 宣布维护者团队两项调整:AWS 高级首席工程师 Clare Liguori 加入 Core Maintainer,Anthropic 技术员工 Den Delimarsky 从 Core Maintainer 升任 Lead Maintainer。
MCP 工具注解自 2025-03-26 规范修订引入,目前包含 readOnlyHint、destructiveHint、idempotentHint、openWorldHint 四个布尔提示,规范明确它们只是"提示",客户端须默认视为不可信。
Steve Yegge 提出"AI 吸血鬼"概念,认为 AI 确实能带来 10 倍生产力,但价值捕获机制决定了开发者要么被公司榨干、要么公司被竞争对手淘汰。他以 Opus 4.5/4.6 配合 Claude Code 为例,称 AI 编程在 2025 年 11 月 24 日到达事件视界,并提到 Claude Code 已在微软工程团队中迅速占据主导。