微软推出决策专用模型 Microsoft-Decision-1,基于 Qwen3.5-9B 后训练
微软发布 Microsoft-Decision-1,一个专做选择题的决策模型,基于阿里开源模型 Qwen3.5-9B 后训练,只做一遍推理就输出结构化结果和校准过的概率分。
微软发布 Microsoft-Decision-1,一个专做选择题的决策模型,基于阿里开源模型 Qwen3.5-9B 后训练,只做一遍推理就输出结构化结果和校准过的概率分。
Aether AI 发布因果驱动的机器人智能系统 CRIS-0,由因果驱动机器人 Agent 与因果世界模型两大组件构成,在真实机器人演示中面对人为干扰的反应速度达 0.1s 级。
生数科技推出视频生成模型 Vidu Q4 Preview,将生成成本压至 0.09 元/秒,图生视频速度达同类模型的 2 倍。该预览版支持最多 15 张参考图、参考音色输入与 2K/4K 画质输出,并提升了人物演绎、镜头调度和复杂特效表现。
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的下一版本,架构未变,仍为 2.5B 激活参数、Apache 2.0 许可。
推荐理由:JetBrains 开源 12B MoE 编码模型,读者可了解其强化学习后训练路线与本地部署的取舍。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,同日还下调了 Sonnet 5.5 与订阅计划价格。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,便于判断小模型在 Agent 工作流中的成本取舍。
Cloudflare 在 Birthday Week 期间开源 Clef 系列决策模型,包含 27B 多模态模型和面向低延迟的 9B Clef-Flash,输入状态与带类型的问题 schema,单次前向传播返回每个选项的概率,不生成自由文本。
OpenAI 今天面向 Plus、Pro、Business 和 Enterprise 用户全球上线带 Intelligent UI 的 GPT-6,并将从明天起扩展至 Free 和 Go 用户。
Google 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、740M 参数的开源多模态嵌入模型,采用 Apache 2.0 许可,可将文本、图像、音频和视频映射到统一嵌入空间。
推荐理由:Google 发布 740M 参数端侧多模态嵌入模型,给出量化内存与向量截断等可核对的部署数据。
Mistral 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、520 亿激活参数的原生多模态模型,权重将于本月底开放。
推荐理由:Mistral 官方给出 ML4 的完整能力清单与开源权重时间表,可据此判断欧洲开源模型在编码与智能体任务上的位置。
Google 在 Gemini API 和 Google AI Studio 发布 Gemini 3.8 Live、3.8 Live Extended Thinking 与 Gemini 3.5 Transcribe。
多款新 LLM 密集亮相:GPT-6 Astra 已进入 ChatGPT 应用,Tibo 称其在 low 档推理下表现优于 GPT-5.6 Sol 的 high 档,并因需求空前可能暂停新的 Pro 订阅。同期被测试的还有 Fable 5.1、Omen Alpha、Muse Spark 1.3、Gemini-3.8-Flash 和 Qwen 3.8 Max 0902 版本。
Google 发布 3.8 Flash,并给出开始构建的入门指引。官方博客提供了上手方式,开发者可据此接入该模型进行开发。
Gemini 3.7 Flash 借助新的智能体视频理解能力,可自动调整处理速度,准确识别并数清每一次拍手。AI 处理视频默认固定 1 FPS,拍手这类瞬间动作容易被漏掉或与响指、点击声混淆。
Google DeepMind 推出 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供,新增场景延展、首尾帧插值、4K 升采样等生成视频控制能力。
智谱开放平台上线 GLM-5.3 与 GLM-5.3-Flash。GLM-5.3 编程能力在内部 Z.ai Code Bench 上较 GLM-5.2 提升 50%,在包括 Terminal Bench 3.0 等公开基准中达到开源模型 SOTA,并联合多个中国安全团队累计发现 2436 个漏洞(1097 个中高危)。
推荐理由:智谱一次性放出 GLM-5.3 与 GLM-5.3-Flash 等多项更新,可对照参数与基准变化判断其编程与多模态能力定位。
本周新版 Qwen 3.8 27B 与神秘模型 Ox Alpha 相继亮相,前者在 20 个编码提示词上完成本地 LLM 基准测试,后者已在 OpenCode 上线并测试了不同思考等级。
本周多款新模型集中发布:GLM-5.3 主打更少输出 token 与网络安全方向,Grok 4.6 已加入 LLM 排行榜并对比 Cursor 与 API 价格,Gemini 3.7 Flash 在 Antigravity 中实测,DeepSeek-v4-Pro 结束预览并公布涨价。
NVIDIA Nemotron 3.5 Lightning 已在 Ollama 上线,可完全在本地设备运行。
推荐理由:NVIDIA 开源 30B 总参数、3B 激活的本地 Agent 模型,可对照其吞吐与上下文规格判断本地部署取舍。
Meta Superintelligence Labs 的首个开源模型 Muse Glimmer 已在 Ollama 上线,这是一个 30B 多模态模型,面向本地运行的 Agent 工作负载,上下文长度 128K+,采用 Apache 2.0 许可。
推荐理由:Meta Superintelligence Labs 首个开源模型在 Ollama 上线,可了解其本地编码 Agent 接入方式与 Apple Silicon 加速表现。