NVIDIA Nemotron 3.5 Lightning 上线 Ollama,30B 总参数 3B 激活
NVIDIA Nemotron 3.5 Lightning 已在 Ollama 上线,可完全在本地设备运行。
推荐理由:NVIDIA 开源 30B 总参数、3B 激活的本地 Agent 模型,可对照其吞吐与上下文规格判断本地部署取舍。
工具与公司
本地运行模型的工具 Ollama 的更新,以及本地模型做编程的实践。
4 条精选近 30 天 0 条共收录 9 条
NVIDIA Nemotron 3.5 Lightning 已在 Ollama 上线,可完全在本地设备运行。
推荐理由:NVIDIA 开源 30B 总参数、3B 激活的本地 Agent 模型,可对照其吞吐与上下文规格判断本地部署取舍。
Meta Superintelligence Labs 的首个开源模型 Muse Glimmer 已在 Ollama 上线,这是一个 30B 多模态模型,面向本地运行的 Agent 工作负载,上下文长度 128K+,采用 Apache 2.0 许可。
推荐理由:Meta Superintelligence Labs 首个开源模型在 Ollama 上线,可了解其本地编码 Agent 接入方式与 Apple Silicon 加速表现。
Ollama 0.31 让 Gemma 4 在 Apple Silicon 上生成 token 平均提速近 90%,该加速默认开启且不改变模型输出。提速来自多 token 预测(MTP):Gemma 4 附带一个小型草稿模型,先提出后续若干 token,主模型一次验证并保留一致的部分,代码场景因可预测性高而受益明显。
推荐理由:原文给出 MTP 加速的实测数据与实现细节,读者可据此判断本地编码 Agent 的响应速度变化。
Ollama 更新 MLX 引擎,称在 Apple Silicon 上达到迄今最高性能,支持 NVIDIA 的 NVFP4 格式,输出速度最高提升 20%,并减少内存占用。
推荐理由:原文给出 MLX 引擎在 Apple Silicon 上的量化、速度与快照机制变化,可据此判断本地跑 Agent 的收益。