跳到正文

内容形态

评测基准 最新动态

SWE-bench、Terminal-Bench 等编程基准与模型、工具的评测结果。

4 条精选近 30 天 3 条共收录 19 条

更新

评测基准的精选

10月8日周四第 1–4 条
10月5日周一
9月28日周一
8月20日周四
  1. Mistral AI62

    Mistral 发布 Agentic Search 检索层,FinanceBench 正确率从 26.7% 升至 86%

    Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查并核实信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。

    推荐理由:原文给出多步检索循环的工具设计与两组基准数据,可据此判断它相对一次性 RAG 的取舍。