中科大团队白泽通境推出溯因式世界模型 AWM,成立三个月获数千万元融资
中科大团队创立的白泽通境推出溯因式世界模型 AWM,先预测再溯因,在 Push-T 任务上仅用 2,000 条轨迹达到 75% 成功率,约为 Causal-JEPA 所需数据的七分之一。
中科大团队创立的白泽通境推出溯因式世界模型 AWM,先预测再溯因,在 Push-T 任务上仅用 2,000 条轨迹达到 75% 成功率,约为 Causal-JEPA 所需数据的七分之一。
GitHub Copilot 本周更新中,Claude Haiku 5.5 已向 Copilot Pro、Pro+、Max、Business 和 Enterprise 用户开放。
推荐理由:汇总了 Copilot 本周在账号分离、本地沙箱和本地模型接入上的多项更新,可据此判断现有工作流的调整空间。
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的下一版本,架构未变,仍为 2.5B 激活参数、Apache 2.0 许可。
推荐理由:JetBrains 开源 12B MoE 编码模型,读者可了解其强化学习后训练路线与本地部署的取舍。
GitHub Copilot CLI 从 1.0.94-0 版本起,可用 /model 发现正在运行的本地 Ollama 实例中的受支持模型,与已配置模型和 GitHub Copilot 云端模型并列展示。
Google 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、740M 参数的开源多模态嵌入模型,采用 Apache 2.0 许可,可将文本、图像、音频和视频映射到统一嵌入空间。
推荐理由:Google 发布 740M 参数端侧多模态嵌入模型,给出量化内存与向量截断等可核对的部署数据。
Ollama 0.35 通过新的 /v1/systemone 端点支持基于 TypeSafe Jev API 的决策模型,可一次性提交文本状态和一组命名问题并本地作答。
Mistral 与 Cloudera 建立合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练自有模型,数据与由此产生的智能均归企业所有。Cloudera 平台承载 30 exabytes 客户自管数据,双方称此举面向对主权 AI 日益增长的需求。
Ollama 将 Pro、Max、Team 计划改为按 token 计费,每档包含每月用量额度:Pro 每月 20 美元含 60 美元用量,Max 每月 100 美元含 300 美元用量,Team 每月 500 美元含 1000 美元共享用量且不限用户数。
本周新版 Qwen 3.8 27B 与神秘模型 Ox Alpha 相继亮相,前者在 20 个编码提示词上完成本地 LLM 基准测试,后者已在 OpenCode 上线并测试了不同思考等级。
Ollama 新增 Claude Desktop 支持,开发者可在 Ollama 中开启 Claude,由其自动配置第三方网关,从而在 Claude 里使用 Ollama 的本地或云端模型,并可随时切回原有 Claude 配置。
Google 公布 Gemma 4 Good Challenge 获奖名单,赛事收到超 1600 份提交,开发者用 LiteRT、Cactus、Ollama、llama.cpp、Unsloth 在受限硬件上部署 Gemma 4。
NVIDIA Nemotron 3.5 Lightning 已在 Ollama 上线,可完全在本地设备运行。
推荐理由:NVIDIA 开源 30B 总参数、3B 激活的本地 Agent 模型,可对照其吞吐与上下文规格判断本地部署取舍。
Meta Superintelligence Labs 的首个开源模型 Muse Glimmer 已在 Ollama 上线,这是一个 30B 多模态模型,面向本地运行的 Agent 工作负载,上下文长度 128K+,采用 Apache 2.0 许可。
推荐理由:Meta Superintelligence Labs 首个开源模型在 Ollama 上线,可了解其本地编码 Agent 接入方式与 Apple Silicon 加速表现。
JetBrains Air 发布新版本,通过 JetBrains 与 Zed 开发的 Agent Client Protocol(ACP)支持 GitHub Copilot、OpenCode、Pi、Cline 等兼容 ACP 的编码 Agent,不再局限于内置的 Claude、Codex、Gemini CLI 和 Junie。
推荐理由:Air 通过 ACP 接入外部编码 Agent 与本地模型,读者可据此判断多 Agent 工作流的接入方式。
Ollama 宣布完成 8800 万美元融资,投资方包括 Benchmark 的 Peter Fenton、Theory Ventures 的 Tomasz Tunguz、8VC 的 Alex Kolicich,以及 Docker 创始人 Solomon Hykes 等天使投资人。
Ollama 0.31 让 Gemma 4 在 Apple Silicon 上生成 token 平均提速近 90%,该加速默认开启且不改变模型输出。提速来自多 token 预测(MTP):Gemma 4 附带一个小型草稿模型,先提出后续若干 token,主模型一次验证并保留一致的部分,代码场景因可预测性高而受益明显。
推荐理由:原文给出 MTP 加速的实测数据与实现细节,读者可据此判断本地编码 Agent 的响应速度变化。
Ollama 更新 MLX 引擎,称在 Apple Silicon 上达到迄今最高性能,支持 NVIDIA 的 NVFP4 格式,输出速度最高提升 20%,并减少内存占用。
推荐理由:原文给出 MLX 引擎在 Apple Silicon 上的量化、速度与快照机制变化,可据此判断本地跑 Agent 的收益。