IndyDevDan· IndyDevDan·· 27 天前AI 评分22
Agentic Engineering 基准测试:GPT-6 Astra、Claude Fable 5.1 与开源权重模型如何排名
Agentic Engineering Benchmarks: How I RANK Astra, Fable 5.1, and Open-Weights
AI 导读
针对 Artificial Analysis Index 把十个基准压成一个数字、丢失选型信息的问题,IndyDevDan 提出只用五个基准来排名 GPT-6 Astra。
来源:IndyDevDan · youtube.com