Google 发布 Android Bench 2.0:新增长周期任务、Agent 评测与连续评分
Google 发布 Android Bench 2.0,新增长周期任务(LHT)、Agent 评测与连续评分,取代此前的二元通过/失败判定。LHT 指需工程师数天甚至一周完成的复杂任务,如升级依赖、从零构建应用、将跨平台应用迁移到 Android。
Google 发布 Android Bench 2.0,新增长周期任务(LHT)、Agent 评测与连续评分,取代此前的二元通过/失败判定。LHT 指需工程师数天甚至一周完成的复杂任务,如升级依赖、从零构建应用、将跨平台应用迁移到 Android。
OpenAI在28天挑战中为GPT-6 Astra和Sol提速50%至50 tokens/s,并上线免费auto-review与ChatGPT Meetings插件;Gemini 4 Argon发布,主打长步骤编码与网络防御,输出达100万token。Mistral Large 4发布,总参数1万亿、激活490亿,月底开放权重,现可在OpenRouter试用。
Gemini CLI 发布 v0.63.0,修复连接恢复时显示重试进度指示器、区分 MCP 启用配置缺失与 JSON 格式错误、恢复能力检测后暂停的 stdin 等问题。核心侧限制工具输出大小并优化长时间运行 Agent 循环的内存生命周期,同时在非交互模式下启用自主计划执行。
Google 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、740M 参数的开源多模态嵌入模型,采用 Apache 2.0 许可,可将文本、图像、音频和视频映射到统一嵌入空间。
推荐理由:Google 发布 740M 参数端侧多模态嵌入模型,给出量化内存与向量截断等可核对的部署数据。
OpenRouter 单周处理 146 万亿 token,一年前仅 4.5 万亿,indydevdan 据此认为 AI 泡沫论站不住脚。DeepSeek、OpenAI 和 Google 几乎全年占据 OpenRouter 市场份额前三,Gemini 3.8 Flash 是其 Pi agent 的默认模型。
Firebase iOS SDK 因后端变更崩溃,导致所有使用 Firebase 分析的应用宕机 2-6 小时,Google 未更新状态页也未提供事后复盘。OpenAI 正效仿 AWS 打造平台,允许将 ChatGPT 预算分配给 16 家合作伙伴的开放模型与 AI 服务。
Google 用 Gemini 3.8 Live Extended Thinking 构建了一个编程辅导工具,能实时看到用户屏幕并通过 function calling 引用 p5.js 库,逐步讲解代码逻辑。该演示展示了模型在调试场景下定位屏幕具体问题的能力。
Google 在 Gemini API 和 Google AI Studio 发布 Gemini 3.8 Live、3.8 Live Extended Thinking 与 Gemini 3.5 Transcribe。
Google DevFest 2026 于 10 月 1 日至 12 月 31 日回归,由全球 Google Developer Groups(GDG)在 115 个国家举办 800 多场活动,预计近百万开发者参与。
多款新 LLM 密集亮相:GPT-6 Astra 已进入 ChatGPT 应用,Tibo 称其在 low 档推理下表现优于 GPT-5.6 Sol 的 high 档,并因需求空前可能暂停新的 Pro 订阅。同期被测试的还有 Fable 5.1、Omen Alpha、Muse Spark 1.3、Gemini-3.8-Flash 和 Qwen 3.8 Max 0902 版本。
Google 发布 3.8 Flash,并给出开始构建的入门指引。官方博客提供了上手方式,开发者可据此接入该模型进行开发。
Gemini 3.8 Flash 被用于在 Google AI Studio 中结合 ThreeJS 构建交互式 3D 可视化工具,测试其复杂推理能力。该模型能自动生成比例真实的硬件设备拆解图,将设备分解为可分层查看的结构,用户可通过拆解滑块展开和检视各层。
Google 发布 8 月 AI 更新汇总,推出面向编码与 Agent 的 Gemini 3.7 Flash,每百万 token 价格为首发 3.6 Flash 的一半,距 3.6 Flash 发布仅三周。
Gemini 3.7 Flash 借助新的智能体视频理解能力,可自动调整处理速度,准确识别并数清每一次拍手。AI 处理视频默认固定 1 FPS,拍手这类瞬间动作容易被漏掉或与响指、点击声混淆。
Google Antigravity 为 Teamwork 框架推出多项更新,该框架让自主 AI 智能体团队协作、互评并迭代数小时至数天,以解决复杂长周期任务。
推荐理由:原文列出多智能体协作在数学与系统工程上的具体产出,可据此判断长周期自主团队框架的实际能力边界。
Google DeepMind 推出 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供,新增场景延展、首尾帧插值、4K 升采样等生成视频控制能力。
Google 公布 Gemma 4 Good Challenge 获奖名单,赛事收到超 1600 份提交,开发者用 LiteRT、Cactus、Ollama、llama.cpp、Unsloth 在受限硬件上部署 Gemma 4。
Google 宣布 Gemma 系列模型累计下载量突破 10 亿次,社区两年来发布超过 10 万个 Gemma 模型变体,形成其称为 Gemmaverse 的生态。
Ollama 0.31 让 Gemma 4 在 Apple Silicon 上生成 token 平均提速近 90%,该加速默认开启且不改变模型输出。提速来自多 token 预测(MTP):Gemma 4 附带一个小型草稿模型,先提出后续若干 token,主模型一次验证并保留一致的部分,代码场景因可预测性高而受益明显。
推荐理由:原文给出 MTP 加速的实测数据与实现细节,读者可据此判断本地编码 Agent 的响应速度变化。