跳到正文
  1. Google Developers62

    Google 发布 EmbeddingGemma 2 开源多模态嵌入模型

    Google 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、740M 参数的开源多模态嵌入模型,采用 Apache 2.0 许可,可将文本、图像、音频和视频映射到统一嵌入空间。

    推荐理由:Google 发布 740M 参数端侧多模态嵌入模型,给出量化内存与向量截断等可核对的部署数据。

  1. Ollama Blog62

    Ollama 0.31 通过多 token 预测让 Gemma 4 在 MLX 上提速近 90%

    Ollama 0.31 让 Gemma 4 在 Apple Silicon 上生成 token 平均提速近 90%,该加速默认开启且不改变模型输出。提速来自多 token 预测(MTP):Gemma 4 附带一个小型草稿模型,先提出后续若干 token,主模型一次验证并保留一致的部分,代码场景因可预测性高而受益明显。

    推荐理由:原文给出 MTP 加速的实测数据与实现细节,读者可据此判断本地编码 Agent 的响应速度变化。

已经到底了