师否
返回博客

美团开源LoHoSearch:用知识图谱校准搜索智能体评测

2026年9月9日9 分钟

美团开源LoHoSearch:用知识图谱校准搜索智能体评测

过去一年,我们见证了搜索智能体(Search Agent)能力的显著演进。在BrowseComp等主流评测基准上,顶尖模型的准确率已从最初的30%区间迅速攀升至90%以上。然而,这种快速的“刷榜”也带来了一个问题:当基准测试被迅速饱和,其区分模型真实能力的价值也随之递减。一个无法拉开差距的“考卷”,自然难以衡量“考生”的真正水平。

现有评测的困境

目前主流的搜索智能体评测方法,大多依赖人工编撰或从特定数据集(如QA、Wikipedia)中采样的问题。这导致了几个固有缺陷:

  1. 同质化严重:问题分布和知识类型趋于集中,容易被模型通过特定训练或记忆覆盖。
  2. 广度与深度不足:单个问题往往只考察孤立知识点,难以检验模型进行多跳推理、信息整合与复杂推理的能力。
  3. 动态性弱:难以持续反映现实世界中不断演变和交叉的信息查询需求。

为了突破这一瓶颈,我们需要一个更强大、更动态、更能模拟真实世界复杂查询的评测框架。

LoHoSearch:一个由知识图谱驱动的评测基准

近期,美团技术团队开源了他们的新一代搜索智能体评测基准——LoHoSearch。其核心创新在于:利用大规模知识图谱来系统性地生成评测问题。这不仅仅是一个新题库,更是一种评测范式的革新。

核心技术思路:从图谱中挖掘“考题”

LoHoSearch的生成流程巧妙地利用了知识图谱的结构化特性:

  1. 锚点与路径选择:从图谱中随机选择一个实体作为起点(锚点),然后沿着图谱的“边”(关系)随机游走,生成一条或多条知识路径。
  2. 问题合成:将这条路径所串联的多个实体和关系,转化为一个自然语言形式的复杂问题。例如,一个简单的“谁发明了电话?”可以演变为“电话发明者出生的城市,其现任市长属于哪个政党?”这类需要连续推理的查询。
  3. 确保质量与多样性:通过控制游走的步长、关系的类型和图谱区域,可以系统性地控制问题的深度(推理步数)、广度(涉及知识领域)和交叉性(不同事实的关联程度),从而保证题库的丰富度与挑战性。

这种方法的好处是显而易见的:

  • 可扩展性:只要知识图谱在更新,评测问题就可以近乎无限地动态生成。
  • 可控的难度:可以精确地生成从简单事实到需要多步、跨域推理的问题。
  • 更接近现实:真实世界的搜索查询往往是复杂和跨领域的,LoHoSearch生成的问题更贴近这种需求。

为什么这很重要?

LoHoSearch的开源,为搜索智能体评测领域提供了一个强有力的校准工具。它迫使模型不能再仅仅依靠表面信息的记忆或简单的检索增强生成(RAG)来“应试”,而必须发展出真正的深度理解、逻辑推理和跨域信息整合能力

这对于整个行业的发展至关重要。只有通过这样更严格、更全面的基准测试,我们才能:

  • 准确评估不同技术路线(如强化学习、规划、工具使用)在真实复杂任务上的表现差异。
  • 指明方向,推动研究从“刷高饱和度基准”转向解决更具挑战性的、接近实际生产环境的核心难题。
  • 建立信任,让用户对部署的智能搜索系统的能力有更可靠的预期。

【相关阅读】 关于AI能力的发展方向,是追求泛化的“超级智能”还是务实的“超级能力”,是一个值得深思的哲学与工程问题。对此有兴趣的读者可以参考:超级能力而非超级智能:AI发展的务实路径

LoHoSearch正是这种务实路径的体现——它专注于解决“让AI可靠地处理复杂信息需求”这一具体而关键的能力。

结语

评测是AI发展的指挥棒。当旧的指挥棒逐渐模糊,新的、更精密的指挥棒就必须出现。美团开源LoHoSearch,正是为下一代搜索智能体的竞争吹响了新的号角。它提醒我们,真正的智能不在于回答了多少简单问题,而在于能否驾驭信息海洋中的复杂航程。

我们期待看到更多研究者和开发者使用LoHoSearch来挑战自己的模型,也期待在它的驱动下,涌现出更多具备深度推理能力的搜索智能体。

(文中提到的评测方法演进,也让人联想到其他AI模型面临的挑战与社区回应。例如,近期有开发者对主流大模型性能变化的观察与讨论:Claude多模型性能下滑,官方紧急回应。同时,如何将自然语言与结构化数据(如数据库)进行交互,是智能体能力的另一重要维度,相关实践可参考:Text2SQL :用自然语言操作 SQLite 数据库。)