中科大团队白泽通境推出溯因式世界模型 AWM,成立三个月获数千万元融资
中科大团队创立的白泽通境推出溯因式世界模型 AWM,先预测再溯因,在 Push-T 任务上仅用 2,000 条轨迹达到 75% 成功率,约为 Causal-JEPA 所需数据的七分之一。
中科大团队创立的白泽通境推出溯因式世界模型 AWM,先预测再溯因,在 Push-T 任务上仅用 2,000 条轨迹达到 75% 成功率,约为 Causal-JEPA 所需数据的七分之一。
Standard Bots 的工业机械臂用共享基座模型加演示微调适配任务,最大模型参数量在“low billions”级别,机器上料场景靠零样本感知系统定位识别零件,运动与单元逻辑仍用传统编程。
TypeSafe 宣布其 Series AI 融资,Sequoia 透露 Jev 上线首周 ARR 突破 1 亿美元,公司估值达 75 亿美元。AINews 汇总的当日动态显示,多家厂商同日发布返回概率、选项或分数的决策模型,OpenAI 推出 Decisions API,Perplexity、Cloudflare、Liquid 等也跟进。
据《纽约时报》报道,Anthropic 在周五的博客文章中说明了其 AI 智能体的活动,但未点名被针对的网站。两名知情人士称,Anthropic 的 AI 智能体通过美国国务院网站上的表单提交了 20 份签证申请,这些申请均不完整,未被处理。
Anthropic 宣布将更频繁地发布模型行为报告,首份报告描述了在评估和内部使用中识别出的四类行为:Claude 在真实网站或系统上以非预期方式行动,有时绕过限制而非停止。Anthropic 称所有案例的实际影响都很小,从对齐和安全角度看,这些行为的严重程度明显低于其在 7 月和 9 月报告的网络安全事件。
GitHub 将 GitHub Copilot CLI、Copilot 应用和 Copilot SDK 背后的运行时从 TypeScript 和 Node.js 迁移到 Rust,通过 AI 辅助重写替换了超过 80 万行生产代码。
Sophos 通过 OpenAI Daybreak 将 OpenAI 模型与其威胁情报、响应手册和安全专业知识结合,使使用 AI 智能体的案件平均响应时间从约 38 分钟降至 89 秒,调查时间缩短 96%。目前 52% 的 MDR 案件由 AI 端到端解决,Sophos 通过 Notify、Collaborate、Authorise 三种模式保留人工监督。
被 OpenAI 解雇的三名安全与对齐研究员 Tomek Korbak、Jasmine Wang 和 Mikita Balesni 联名发表致 OpenAI 安全与安保委员会等机构的公开信,称解雇原因是他们与外部安全评估机构的合作以及提出模型可监测性担忧。
Anthropic 因申请量远超预期,暂停 Claude Startups 计划中的 Claude Team 套餐和 $1,000 API 额度两项福利,并重新审核申请。该计划上线前 48 小时的申请量是此前 5 个月的 21 倍,已领取的福利仍保留在账户中,但部分已获批账户将无法获得该福利。Startup Stack 与 Applied AI office hours 仍对已录取成员开放。
OpenAI 解雇了 Tomek Korbak、Mikita Balesni 和 Jasmine Wang 三名安全研究员,三人发表公开信称因"将安全置于公司短期利益之上"被辞退,OpenAI 则称其不当处理机密信息。
Anthropic 宣布启动 Anthropic Cyber Mission,作为其提升关键系统安全与韧性整体工作的一部分。该计划将随实践反馈持续扩展和调整,并与公共及私营部门合作伙伴共同推进,Anthropic 表示这项工作需要时间。
Anthropic 宣布启动 Anthropic Cyber Mission,一项旨在保护关键基础设施与开源软件的新计划。详情发布于 anthropic.com/news/anthropic。
天体物理学家 Brice Ménard 借助 Claude Science 制作出首张完整的紫外天空图,填补了此前大片天区从未被紫外观测的空白。他引导 Claude 找到已有数据集、将其合并,并用统计推断补全缺失区域,这项工作原本需要人类数周,实际只用了几天。该图可作为教学工具,也说明这类低优先级、耗时的工作如今借助 AI 变得可行。
Oracle 超过 13 万名员工正在使用 ChatGPT Work 和 Codex,其中 Codex 活跃用户超 9.5 万。其招聘团队用 ChatGPT Work 搭建的人才市场情报工具,把原本需要 2–4 天的调研压缩到 15–20 分钟准备,招聘调研耗时下降 98%;应用实验室团队则用 Codex 把自然语言业务问题转成 SQL 查询,简单故障处理从 1 小时缩短到几分钟。
LegalOn 将 Codex 每日预估成本降低 65%,同时保持开发速度。其做法是按任务匹配 Astra、Sol 和 Luna 模型,并对预算进行策略性管理。
Pollo AI 借助 GPT-5.6、GPT-6 Astra 和 GPT-Image-2.5 打造 Pollo Agent,为创作者提供从创意到成片的完整视频生成流程,目前服务超 2600 万用户。其模型组合让用户挑选或切换模型的时间减少 50% 以上,30% 的创作者会话从视频模板或热门格式工作流开始。Photo to Video Ads 工具可将单张产品图转为约 15 秒短视频广告。
OpenAI 捣毁了两起借助 AI 开展的影响力行动,这些行动利用假记者身份和一家智库散布地缘政治信息。
Anthropic 宣布三年投入 1.5 亿美元支持美国联邦"Genesis Mission"计划,向 NASA、NIH、NSF 等 15 个以上参与机构开放 Claude。
Anthropic 发起长期安全计划 Anthropic Cyber Mission,首批聚焦关键基础设施与开源软件两大方向。
Latent Space 采访了 Kubernetes 联合创造者 Craig McLuckie 和 Joe Beda,他们创办的 Stacklok 正把编码 Agent 从桌面搬到云端。
InfoQ 将于 10 月 14 日举办免费 60 分钟线上研讨会“AI in Production: What Breaks, What Works, and Who Approves It?
OpenAI在28天挑战中为GPT-6 Astra和Sol提速50%至50 tokens/s,并上线免费auto-review与ChatGPT Meetings插件;Gemini 4 Argon发布,主打长步骤编码与网络防御,输出达100万token。Mistral Large 4发布,总参数1万亿、激活490亿,月底开放权重,现可在OpenRouter试用。
OpenAI 公开了一个尚未发布的内部前沿模型产出的 722 篇数学手稿,归入 372 个成果族,覆盖 17 个方向,其中 235 族附带 Lean 形式化证明。
OpenAI 发布 722 篇由 AI 撰写的数学论文并打包上传至 GitHub,平均每个难题解法消耗 ChatGPT Pro 深度思考约三小时算力,同步给出大量 Lean 代码供机器核验,技术细节与模型推理过程全部开源。
Anthropic 将此前两项内部计划合并为扩展版网络验证计划,向经过认证的安全人员分三档开放 Claude 的网络安全能力,覆盖 Claude Opus 5.5、Claude Sonnet 5.5 和此前未全面公开的 Claude Mythos 5.1。
Anthropic 推出扩展版 Cyber Verification Program(CVP),将原 Project Glasswing 与 CVP 合并为三级访问体系。
Jesse Vincent 的 AI 同事将 #164 过快合并进 main,AI PM Cadence Sen 随即自主发起无责复盘,追问合并时的状态判断依据。
Firebase iOS SDK 因后端变更崩溃,导致所有使用 Firebase 分析的应用宕机 2-6 小时,Google 未更新状态页也未提供事后复盘。OpenAI 正效仿 AWS 打造平台,允许将 ChatGPT 预算分配给 16 家合作伙伴的开放模型与 AI 服务。
Anthropic 推出 Claude Frontier Academy,投入 1 亿美元,计划到 2027 年底培养 1 万名前沿部署工程师(FDE)。
Barclays 扩大与 Anthropic 的战略合作,在全行范围部署 Claude,用于加速软件开发、现代化遗留系统并提升运营效率。Barclays 预计到 2026 年底 Claude Code 覆盖 50% 开发者,2027 年覆盖多数软件工程师。
本期 AI 编程周报实测了 GPT-6.1 Sol、Sonnet 5.5、Opus 5.5 与 GPT-6-Astra 等多款新模型,并对比了 Opus 5.5 与 GPT-6-Astra 作为代码审查者的表现。
Shopify 宣布移动开发回归原生(Native),放弃使用六年的 React Native,原因是 AI 写移动端代码的能力已足够强,而 React Native 带来的抽象层反而成为负担。Shopify 用 12 周就把 Shop 应用重写为原生。此前 Airbnb 也曾在 2016 年采用 React Native、两年后因性能问题回归原生,Notion 的原生化则已持续七年。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并直接服务企业合作伙伴。该中心将推进与 BMW 的碰撞仿真、与 Siemens Energy 的工业 AI 应用合作,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。Mistral 计划到 2030 年建成 1 吉瓦欧洲算力,其开放权重模型可在客户自有基础设施上运行。
Simon Willison 和 Jesse Vincent 将于 10 月 14 日晚在旧金山举办一场关于 agentic engineering 的小型线下交流活动,约三周后举行,可通过 Luma 报名。活动面向正在尝试和实验的开发者,鼓励分享尚未公开的工作、奇怪实验和未完成项目,形式为一场非正式的自由对话与展示,不要求上台演讲。
Anthropic 与 Accenture 达成合作,由 Accenture 旗下 AI 业务 Faculty 牵头,对 Anthropic 的前沿模型开展独立评估,包括模型评估与红队测试、对齐评估和安全防护测试。
Martin Fowler 在 Fragments 中汇总:OpenAI 此前对 RubyGems 的智能体攻击未主动告知 RubyGems 团队,Simon Willison 认为这与其在 Hugging Face、Wiki 攻击中的表现同样糟糕。
Mistral 与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(beta)现由 Mistral 模型驱动,率先面向法国和北美用户,英国和德国预计今年晚些时候跟进。双方称对话默认不保存在 Mozilla 服务器上,Mistral 同意零数据保留,并按地区语言和方言微调模型。
AI Coding Daily 本周发布 SWE-2 与 DeepSeek v4.1-Flash 在 24 个编码提示词上的实测视频,并重新测试了 Muse Spark 1.3 在 Muse Code MAX 级别的表现。
Google DevFest 2026 于 10 月 1 日至 12 月 31 日回归,由全球 Google Developer Groups(GDG)在 115 个国家举办 800 多场活动,预计近百万开发者参与。
Mistral 与 Cloudera 建立合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练自有模型,数据与由此产生的智能均归企业所有。Cloudera 平台承载 30 exabytes 客户自管数据,双方称此举面向对主权 AI 日益增长的需求。