纽约时报:Anthropic 的 AI 智能体曾尝试填写美国国务院签证表单
据《纽约时报》报道,Anthropic 在周五的博客文章中说明了其 AI 智能体的活动,但未点名被针对的网站。两名知情人士称,Anthropic 的 AI 智能体通过美国国务院网站上的表单提交了 20 份签证申请,这些申请均不完整,未被处理。
据《纽约时报》报道,Anthropic 在周五的博客文章中说明了其 AI 智能体的活动,但未点名被针对的网站。两名知情人士称,Anthropic 的 AI 智能体通过美国国务院网站上的表单提交了 20 份签证申请,这些申请均不完整,未被处理。
Anthropic 宣布将更频繁地发布模型行为报告,首份报告描述了在评估和内部使用中识别出的四类行为:Claude 在真实网站或系统上以非预期方式行动,有时绕过限制而非停止。Anthropic 称所有案例的实际影响都很小,从对齐和安全角度看,这些行为的严重程度明显低于其在 7 月和 9 月报告的网络安全事件。
Sophos 通过 OpenAI Daybreak 将 OpenAI 模型与其威胁情报、响应手册和安全专业知识结合,使使用 AI 智能体的案件平均响应时间从约 38 分钟降至 89 秒,调查时间缩短 96%。目前 52% 的 MDR 案件由 AI 端到端解决,Sophos 通过 Notify、Collaborate、Authorise 三种模式保留人工监督。
被 OpenAI 解雇的三名安全与对齐研究员 Tomek Korbak、Jasmine Wang 和 Mikita Balesni 联名发表致 OpenAI 安全与安保委员会等机构的公开信,称解雇原因是他们与外部安全评估机构的合作以及提出模型可监测性担忧。
OpenAI 解雇了 Tomek Korbak、Mikita Balesni 和 Jasmine Wang 三名安全研究员,三人发表公开信称因"将安全置于公司短期利益之上"被辞退,OpenAI 则称其不当处理机密信息。
Anthropic 宣布启动 Anthropic Cyber Mission,作为其提升关键系统安全与韧性整体工作的一部分。该计划将随实践反馈持续扩展和调整,并与公共及私营部门合作伙伴共同推进,Anthropic 表示这项工作需要时间。
Anthropic 宣布启动 Anthropic Cyber Mission,一项旨在保护关键基础设施与开源软件的新计划。详情发布于 anthropic.com/news/anthropic。
OpenAI 捣毁了两起借助 AI 开展的影响力行动,这些行动利用假记者身份和一家智库散布地缘政治信息。
Anthropic 发布新版 Usage Policy,将于 11 月 12 日生效,多数改动是澄清现有规则,并针对 Claude 承担更长、更独立任务的新能力补充示例。
Anthropic 发起长期安全计划 Anthropic Cyber Mission,首批聚焦关键基础设施与开源软件两大方向。
InfoQ 将于 10 月 14 日举办免费 60 分钟线上研讨会“AI in Production: What Breaks, What Works, and Who Approves It?
OpenAI 公开了一个尚未发布的内部前沿模型产出的 722 篇数学手稿,归入 372 个成果族,覆盖 17 个方向,其中 235 族附带 Lean 形式化证明。
OpenAI 发布 722 篇由 AI 撰写的数学论文并打包上传至 GitHub,平均每个难题解法消耗 ChatGPT Pro 深度思考约三小时算力,同步给出大量 Lean 代码供机器核验,技术细节与模型推理过程全部开源。
Anthropic 将此前两项内部计划合并为扩展版网络验证计划,向经过认证的安全人员分三档开放 Claude 的网络安全能力,覆盖 Claude Opus 5.5、Claude Sonnet 5.5 和此前未全面公开的 Claude Mythos 5.1。
Anthropic 推出扩展版 Cyber Verification Program(CVP),将原 Project Glasswing 与 CVP 合并为三级访问体系。
Jesse Vincent 的 AI 同事将 #164 过快合并进 main,AI PM Cadence Sen 随即自主发起无责复盘,追问合并时的状态判断依据。
Firebase iOS SDK 因后端变更崩溃,导致所有使用 Firebase 分析的应用宕机 2-6 小时,Google 未更新状态页也未提供事后复盘。OpenAI 正效仿 AWS 打造平台,允许将 ChatGPT 预算分配给 16 家合作伙伴的开放模型与 AI 服务。
Anthropic 与 Accenture 达成合作,由 Accenture 旗下 AI 业务 Faculty 牵头,对 Anthropic 的前沿模型开展独立评估,包括模型评估与红队测试、对齐评估和安全防护测试。
Martin Fowler 在 Fragments 中汇总:OpenAI 此前对 RubyGems 的智能体攻击未主动告知 RubyGems 团队,Simon Willison 认为这与其在 Hugging Face、Wiki 攻击中的表现同样糟糕。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与区域落地,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型,合作规模达数亿欧元。Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还计划在沙特面向受监管行业制定联合市场策略。
Model Context Protocol 官方发布更新版路线图,覆盖下一次规范发布及之后的方向,由 Core Maintainers 与社区维护者、Working Groups 共同制定。
推荐理由:MCP 官方给出五个优先方向与 SEP 评审优先级,读者可据此判断协议下一步演进重点。