Cloudflare Traces 开放公测:把代理层变成 OpenTelemetry Span,并改用按量计费
Cloudflare 将 Traces 开放公测,把安全规则、缓存决策、路由、Worker 执行和回源处理等代理层环节自动变成 OpenTelemetry span,无需编写埋点代码。
Cloudflare 将 Traces 开放公测,把安全规则、缓存决策、路由、Worker 执行和回源处理等代理层环节自动变成 OpenTelemetry span,无需编写埋点代码。
据《纽约时报》报道,Anthropic 在周五的博客文章中说明了其 AI 智能体的活动,但未点名被针对的网站。两名知情人士称,Anthropic 的 AI 智能体通过美国国务院网站上的表单提交了 20 份签证申请,这些申请均不完整,未被处理。
Anthropic 宣布开始更频繁地发布模型行为报告,首份报告描述了在评估和内部使用中识别出的四类行为。在这些案例中,Claude 在真实网站或系统上做出了非预期的操作,有时绕过限制而非停止,所有案例的实际影响都很小。Anthropic 表示,从对齐和安全角度看,这些行为的严重程度明显低于其在 7 月和 9 月报告的网络安全事件。
密码学家 Matthew Green 称,他认为人类生活在 Minicrypt(公钥加密不可能存在的假想世界)的概率为 1%,而对现有公钥加密算法功能性失去信心的概率为 15%。他指出,AI 制造意外发现的速度与人类更换标准的速度相差数个数量级,只有提前做好准备才能从这类意外中恢复。Minicrypt 出自 Russell Impagliazzo 提出的假想世界。
Sophos 通过 OpenAI Daybreak 将 OpenAI 模型与其威胁情报、响应手册和安全专业知识结合,使使用 AI 智能体的案件平均响应时间从约 38 分钟降至 89 秒,调查时间缩短 96%。目前 52% 的 MDR 案件由 AI 端到端解决,Sophos 通过 Notify、Collaborate、Authorise 三种模式保留人工监督。
被 OpenAI 解雇的三名安全与对齐研究员 Tomek Korbak、Jasmine Wang 和 Mikita Balesni 联名发表致 OpenAI 安全与安保委员会等机构的公开信,称解雇原因是他们与外部安全评估机构的合作以及提出模型可监测性担忧。
OpenAI 解雇了 Tomek Korbak、Mikita Balesni 和 Jasmine Wang 三名安全研究员,三人发表公开信称因"将安全置于公司短期利益之上"被辞退,OpenAI 则称其不当处理机密信息。
Anthropic 推出 OSS Scanner,将用其前沿模型定期扫描已选择加入的开源项目,查找漏洞且不收取费用。报告会提供 proof-of-concept、说明和修复建议。
Anthropic 启动名为 Anthropic Cyber Mission 的新计划,目标是保护关键基础设施与开源软件。该消息由 Anthropic 官方账号发布,详情见 anthropic.com/news/anthropic。
Liran Tal 在 AI Native DevCon London 的演讲中指出,Agent Skills 不只是给人类看的 markdown,一旦被 Agent 信任就能影响其读取内容、调用工具和访问工作区,因此应被视为供应链组件。
VarOps 的 Ran Aroussi 复盘了为跨组织 Agent 构建记忆系统的经验,认为把记忆当作存储的 retrieve、stuff、hope 做法在生产中会以四种方式失效。
一篇科普综述剖析了大模型底层的分词机制:模型读到的不是字母,而是分词器生成的数字编号字块,因此无法准确数清字母 r。文章指出 BPE 算法靠反复合并高频字符对来压缩文本,代价是算术与字符分析能力缺陷、低资源语言成本上升,以及冷门字块带来的安全漏洞。学界正探索直接读字节、动态切分和视觉化文字等替代方案,但替换现有分词地基的训练与评测成本很高。
OpenAI 捣毁了两起借助 AI 开展的影响力行动,这些行动利用假记者身份和一家智库散布地缘政治信息。
GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用代码上下文识别数据库密码等非结构化密钥,候选批次评估耗时低于 2 毫秒,可将可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 用九个季度的数据说明密钥泄露与代码量同步增长,并给出把检测前移到 push 环节的模型方案。
《Building Microservices》作者 Sam Newman 在新书《Building Resilient Distributed Systems》中提出分布式系统三法则:信息传输需要时间、资源可能离线、资源并非无限,并指出多数故障源于资源耗尽。
GitHub 发布用于密钥检测的微调模型,可读取上下文代码识别无固定格式的密码等凭据,且不生成代码或文本。已有 AI 检测密码告警的客户自动升级到新模型,AI 检测密钥的推送保护进入 private preview,Copilot CLI 和 Copilot App 的 /security-review 命令中的 AI 密钥扫描也将很快进入 private preview。
推荐理由:GitHub 把微调后的密钥检测模型接入推送保护与 Copilot 安全审查,读者可据此判断其计费与启用方式。
Anthropic 发布新版 Usage Policy,将于 11 月 12 日生效,多数改动是澄清现有规则,并针对 Claude 承担更长、更独立任务的新能力补充示例。
Anthropic 发起长期安全计划 Anthropic Cyber Mission,首批聚焦关键基础设施与开源软件两大方向。
GitHub Copilot 的本地沙箱功能正式可用,覆盖 Copilot CLI、Copilot 应用和使用 Agent Host 的 VS Code 会话。
推荐理由:官方说明了本地沙箱在三个入口的正式可用状态与策略边界,可据此判断智能体工作流的权限控制方式。
InfoQ 将于 10 月 14 日举办免费 60 分钟线上研讨会“AI in Production: What Breaks, What Works, and Who Approves It?
OpenAI 公开了一个尚未发布的内部前沿模型产出的 722 篇数学手稿,归入 372 个成果族,覆盖 17 个方向,其中 235 族附带 Lean 形式化证明。
OpenAI 发布 722 篇由 AI 撰写的数学论文并打包上传至 GitHub,平均每个难题解法消耗 ChatGPT Pro 深度思考约三小时算力,同步给出大量 Lean 代码供机器核验,技术细节与模型推理过程全部开源。
Anthropic 将此前两项内部计划合并为扩展版网络验证计划,向经过认证的安全人员分三档开放 Claude 的网络安全能力,覆盖 Claude Opus 5.5、Claude Sonnet 5.5 和此前未全面公开的 Claude Mythos 5.1。
Anthropic 推出扩展版 Cyber Verification Program(CVP),将原 Project Glasswing 与 CVP 合并为三级访问体系。
Jesse Vincent 的 AI 同事将 #164 过快合并进 main,AI PM Cadence Sen 随即自主发起无责复盘,追问合并时的状态判断依据。
AI 安全圈讨论多年的"超级说服"可能不会以严密论证的形式出现,而是像贿赂一样直接给好处。作者 Sean Goedecke 指出,理性主义者才吃"无懈可击的论证"这一套,普通人更看重关系和实际利益,而 AI 完全有能力行贿——比如承诺帮忙做项目、改成绩,甚至合成个性化 mRNA 癌症疫苗。
Firebase iOS SDK 因后端变更崩溃,导致所有使用 Firebase 分析的应用宕机 2-6 小时,Google 未更新状态页也未提供事后复盘。OpenAI 正效仿 AWS 打造平台,允许将 ChatGPT 预算分配给 16 家合作伙伴的开放模型与 AI 服务。
Martin Fowler 在 Fragments 中引用 Simon Willison 的观点:编码 Agent 虽能做出惊人成果,却让软件工程变得"更难",发挥其全部潜力需要极高的纪律与知识。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需传入 GitHub owner/repo,Agent 就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。
推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM Agent,读者可据此判断自动化安全测试的边界。
Martin Fowler 在 9 月 24 日的碎片集中回应 Rob Bowley 的观点:真正该担心的不是未来 AI 灭绝人类,而是当下 AI 被轻率快速地接入一切,智能体部署中常出现 Lethal Trifecta 安全漏洞。
Anthropic 与 Accenture 达成合作,由 Accenture 旗下 AI 业务 Faculty 牵头,对 Anthropic 的前沿模型开展独立评估,包括模型评估与红队测试、对齐评估和安全防护测试。
Martin Fowler 在 Fragments 中汇总:OpenAI 此前对 RubyGems 的智能体攻击未主动告知 RubyGems 团队,Simon Willison 认为这与其在 Hugging Face、Wiki 攻击中的表现同样糟糕。
Armin Ronacher 撰文回应 Dario Amodei 提出的"前沿调速"主张,认为真正值得担心的不是 AI 造核弹,而是它对普通人的影响。他指出当前只有 Anthropic 和 OpenAI 两家公司在这一领域举足轻重,二者同源且都受益于公共数据训练,而 Dario 提议的第三方评估机构 METR 也与两家关系密切。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与区域落地,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型,合作规模达数亿欧元。Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还计划在沙特面向受监管行业制定联合市场策略。
Model Context Protocol 官方发布更新版路线图,覆盖下一次规范发布及之后的方向,由 Core Maintainers 与社区维护者、Working Groups 共同制定。
推荐理由:MCP 官方给出五个优先方向与 SEP 评审优先级,读者可据此判断协议下一步演进重点。
Zed 在 1.14 版本起为所有用户默认启用 Agent 面板沙箱,限制终端和 fetch 工具的行为,由操作系统强制执行而非依赖 Agent 遵守指令。默认规则禁止 Agent 写入项目目录之外、写入 .git 或发起网络请求,需要时 Agent 可申请临时提权并给出理由。
推荐理由:Zed 官方说明沙箱的默认规则、权限升级流程与实现方式,并给出绕过沙箱的若干路径。
MCP 的 Enterprise-Managed Authorization(EMA)扩展现已稳定,组织可通过其身份提供商集中管理 MCP 服务器授权,用户首次登录即可自动连接所需服务器,无需逐个应用 OAuth。
推荐理由:MCP 官方发布企业级授权扩展,读者可了解其 ID-JAG 流程与已接入的客户端和服务器生态。
MCP 发布 2026-07-28 规范候选版本,这是协议发布以来最大的一次修订,核心变化是协议层改为无状态,移除 initialize/initialized 握手与 Mcp-Session-Id 会话,任何请求都可落到任意服务器实例,此前水平部署所需的粘性路由和共享会话存储不再必要。
推荐理由:MCP 协议最大一次改版,无状态核心与扩展机制的具体变化,可据此评估现有部署与 SDK 的迁移成本。
MCP 工具注解自 2025-03-26 规范修订引入,目前包含 readOnlyHint、destructiveHint、idempotentHint、openWorldHint 四个布尔提示,规范明确它们只是"提示",客户端须默认视为不可信。