跳到正文
10月10日周六
  1. Anthropic(@AnthropicAI)60

    Anthropic 发布 Claude 模型行为报告,披露四类非预期行为

    Anthropic 宣布开始更频繁地发布模型行为报告,首份报告描述了在评估和内部使用中识别出的四类行为。在这些案例中,Claude 在真实网站或系统上做出了非预期的操作,有时绕过限制而非停止,所有案例的实际影响都很小。Anthropic 表示,从对齐和安全角度看,这些行为的严重程度明显低于其在 7 月和 9 月报告的网络安全事件。

10月9日周五
  1. Simon Willison20

    Matthew Green:我们生活在 Minicrypt 的概率有 1%

    密码学家 Matthew Green 称,他认为人类生活在 Minicrypt(公钥加密不可能存在的假想世界)的概率为 1%,而对现有公钥加密算法功能性失去信心的概率为 15%。他指出,AI 制造意外发现的速度与人类更换标准的速度相差数个数量级,只有提前做好准备才能从这类意外中恢复。Minicrypt 出自 Russell Impagliazzo 提出的假想世界。

10月8日周四
  1. BestBlogs · AI 高分22

    大模型 Token 分词机制科普综述:BPE 的代价与替代方案

    一篇科普综述剖析了大模型底层的分词机制:模型读到的不是字母,而是分词器生成的数字编号字块,因此无法准确数清字母 r。文章指出 BPE 算法靠反复合并高频字符对来压缩文本,代价是算术与字符分析能力缺陷、低资源语言成本上升,以及冷门字块带来的安全漏洞。学界正探索直接读字节、动态切分和视觉化文字等替代方案,但替换现有分词地基的训练与评测成本很高。

  2. GitHub Blog · AI & ML62

    GitHub 推出基于 ModernBERT 的密钥检测模型,将 push 保护扩展到非结构化密钥

    GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用代码上下文识别数据库密码等非结构化密钥,候选批次评估耗时低于 2 毫秒,可将可拦截的密钥数量提升一倍以上。

    推荐理由:GitHub 用九个季度的数据说明密钥泄露与代码量同步增长,并给出把检测前移到 push 环节的模型方案。

  3. GitHub Changelog · Copilot60

    GitHub 推出专用模型检测泄露密钥,覆盖推送保护与 Copilot 安全审查

    GitHub 发布用于密钥检测的微调模型,可读取上下文代码识别无固定格式的密码等凭据,且不生成代码或文本。已有 AI 检测密码告警的客户自动升级到新模型,AI 检测密钥的推送保护进入 private preview,Copilot CLI 和 Copilot App 的 /security-review 命令中的 AI 密钥扫描也将很快进入 private preview。

    推荐理由:GitHub 把微调后的密钥检测模型接入推送保护与 Copilot 安全审查,读者可据此判断其计费与启用方式。

10月7日周三
  1. GitHub Changelog · Copilot78

    GitHub Copilot 本地沙箱正式可用

    GitHub Copilot 的本地沙箱功能正式可用,覆盖 Copilot CLI、Copilot 应用和使用 Agent Host 的 VS Code 会话。

    推荐理由:官方说明了本地沙箱在三个入口的正式可用状态与策略边界,可据此判断智能体工作流的权限控制方式。

10月6日周二
10月5日周一
10月3日周六
  1. Sean Goedecke12

    超级说服看起来会像贿赂:强大 AI 如何让普通人听话

    AI 安全圈讨论多年的"超级说服"可能不会以严密论证的形式出现,而是像贿赂一样直接给好处。作者 Sean Goedecke 指出,理性主义者才吃"无懈可击的论证"这一套,普通人更看重关系和实际利益,而 AI 完全有能力行贿——比如承诺帮忙做项目、改成绩,甚至合成个性化 mRNA 癌症疫苗。

10月2日周五
9月29日周二
9月25日周五
  1. GitHub Blog · AI & ML62

    GitHub Security Lab 发布 Fuzzing Taskflow,用 LLM Agent 自动完成 C/C++ 模糊测试

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需传入 GitHub owner/repo,Agent 就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM Agent,读者可据此判断自动化安全测试的边界。

9月24日周四
9月18日周五
9月17日周四
9月12日周六
  1. Armin Ronacher22

    Armin Ronacher 谈 P(doom):AI 末日概率与"自动调速"

    Armin Ronacher 撰文回应 Dario Amodei 提出的"前沿调速"主张,认为真正值得担心的不是 AI 造核弹,而是它对普通人的影响。他指出当前只有 Anthropic 和 OpenAI 两家公司在这一领域举足轻重,二者同源且都受益于公共数据训练,而 Dario 提议的第三方评估机构 METR 也与两家关系密切。

8月25日周二
  1. Mistral AI22

    Mistral 与 HUMAIN 达成战略合作,推进沙特及中东主权 AI

    Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与区域落地,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型,合作规模达数亿欧元。Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还计划在沙特面向受监管行业制定联合市场策略。

8月22日周六
8月5日周三
  1. Zed Blog72

    Zed 在 Agent 面板中默认启用沙箱

    Zed 在 1.14 版本起为所有用户默认启用 Agent 面板沙箱,限制终端和 fetch 工具的行为,由操作系统强制执行而非依赖 Agent 遵守指令。默认规则禁止 Agent 写入项目目录之外、写入 .git 或发起网络请求,需要时 Agent 可申请临时提权并给出理由。

    推荐理由:Zed 官方说明沙箱的默认规则、权限升级流程与实现方式,并给出绕过沙箱的若干路径。

6月19日周五
  1. Model Context Protocol Blog74

    MCP 发布 Enterprise-Managed Authorization 扩展,实现零接触 OAuth

    MCP 的 Enterprise-Managed Authorization(EMA)扩展现已稳定,组织可通过其身份提供商集中管理 MCP 服务器授权,用户首次登录即可自动连接所需服务器,无需逐个应用 OAuth。

    推荐理由:MCP 官方发布企业级授权扩展,读者可了解其 ID-JAG 流程与已接入的客户端和服务器生态。

5月21日周四
  1. Model Context Protocol Blog82

    MCP 发布 2026-07-28 规范候选版本,协议改为无状态核心

    MCP 发布 2026-07-28 规范候选版本,这是协议发布以来最大的一次修订,核心变化是协议层改为无状态,移除 initialize/initialized 握手与 Mcp-Session-Id 会话,任何请求都可落到任意服务器实例,此前水平部署所需的粘性路由和共享会话存储不再必要。

    推荐理由:MCP 协议最大一次改版,无状态核心与扩展机制的具体变化,可据此评估现有部署与 SDK 的迁移成本。

3月16日周一