跳到正文
IndyDevDan· IndyDevDan·· 27 天前AI 评分22

Agentic Engineering 基准测试:GPT-6 Astra、Claude Fable 5.1 与开源权重模型如何排名

Agentic Engineering Benchmarks: How I RANK Astra, Fable 5.1, and Open-Weights

AI 导读

针对 Artificial Analysis Index 把十个基准压成一个数字、丢失选型信息的问题,IndyDevDan 提出只用五个基准来排名 GPT-6 Astra。

来源:IndyDevDan · youtube.com