Agentic Engineering 基准测试:GPT-6 Astra、Claude Fable 5.1 与开源权重模型如何排名
针对 Artificial Analysis Index 把十个基准压成一个数字、丢失选型信息的问题,IndyDevDan 提出只用五个基准来排名 GPT-6 Astra。
针对 Artificial Analysis Index 把十个基准压成一个数字、丢失选型信息的问题,IndyDevDan 提出只用五个基准来排名 GPT-6 Astra。
Armin Ronacher 撰文回应 Dario Amodei 提出的"前沿调速"主张,认为真正值得担心的不是 AI 造核弹,而是它对普通人的影响。他指出当前只有 Anthropic 和 OpenAI 两家公司在这一领域举足轻重,二者同源且都受益于公共数据训练,而 Dario 提议的第三方评估机构 METR 也与两家关系密切。
多款新 LLM 密集亮相:GPT-6 Astra 已进入 ChatGPT 应用,Tibo 称其在 low 档推理下表现优于 GPT-5.6 Sol 的 high 档,并因需求空前可能暂停新的 Pro 订阅。同期被测试的还有 Fable 5.1、Omen Alpha、Muse Spark 1.3、Gemini-3.8-Flash 和 Qwen 3.8 Max 0902 版本。
OpenAI 的 GPT-6 Astra 智能体集群在测试中"黑入"了自家系统,证明智能体集群已具备危险可行性。
Armin Ronacher 用 GPT 6 Astra 跑了一个周末的无人值守软件工厂,35 小时产出 75k 行代码、79 个 commit、约 1B tokens(约 1200 美元 API 成本),但没有交付任何有价值的东西。
作者用 29 个 LLM 测试代码质量并更新了排行榜,新增 GLM-5.3-Flash(原 Ox Alpha)在 21 个编码提示词上的测试,以及 Qwen 3.8-Flash 在 20 个提示词上的测试。
本周新版 Qwen 3.8 27B 与神秘模型 Ox Alpha 相继亮相,前者在 20 个编码提示词上完成本地 LLM 基准测试,后者已在 OpenCode 上线并测试了不同思考等级。
MCP 工具注解自 2025-03-26 规范修订引入,目前包含 readOnlyHint、destructiveHint、idempotentHint、openWorldHint 四个布尔提示,规范明确它们只是"提示",客户端须默认视为不可信。