最强搜索智能体GPT-5.5在BrowseComp上准确率超过90%,但在美团最新开源的LoHoSearch上却只有34.74%——差距不是一点点,而是直接腰斩再腰斩。为什么同一个模型,换个考场就'水土不服'?因为LoHoSearch的考题不是人出的,而是机器基于知识图谱自动生成的,专挑人工出题想不到的'刁钻角度'。

过去一年,Search Agent(搜索智能体,能自主规划搜索步骤并整合信息的AI系统)能力突飞猛进,BrowseComp等基准的准确率从30%飙到90%以上。但基准饱和后,区分度下降——人工设计的题目受限于出题者的知识范围,无法站在全局知识网络视角判断哪些条件真的难检索。美团LongCat团队提出的LoHoSearch,正是要打破这个天花板。

LoHoSearch的核心思路是:让机器自己出题。首先,基于完整英文维基百科构建一张包含762万实体、2.65亿条有向边的知识图谱(以实体和关系组织的结构化知识网络)。然后,从两个维度控制题目难度:搜索空间(满足条件的候选实体数量)和结构复杂度(需要同时满足的条件数量)。通过树结构和图结构两种子图模式,系统化生成高难度题目。

生成题目后,经过自动验证、人工复核三层把关,最终收录544道经人工核验的题目,覆盖11个领域。整体质量表现:75.5%直接通过,22.3%微调后接受,仅2.2%被丢弃。

在LoHoSearch上,最强模型GPT-5.5准确率仅34.74%,DeepSeek-V4-Pro、Claude-Opus-4.6、Kimi-K2.6集中在15.53%–15.99%,其余均低于14%。这与它们在BrowseComp上80%以上的表现形成鲜明对照。四个洞察揭示了搜索智能体的真实短板。

洞察一:解一道LoHoSearch题目,平均工具调用从35次增至61次(+74%),中位数从26次升至59次。图结构题目准确率仅8.01%,远低于树结构的11.89%,说明结构复杂度是独立于搜索空间之外的额外难度来源。

洞察二:重复采样收益可观,但天花板依然很低。对DeepSeek-V4-Flash采样16次,pass@N(多次采样中至少一次成功的概率)从9.3%升至38.3%,但仍有六成以上题目无法攻克。best-of-N聚合策略仅24.6%,远低于pass@16上界,说明模型在答案置信度校准上存在明显不足。

洞察三:现有上下文管理策略在LoHoSearch上效果大打折扣。以标准ReAct(推理-行动循环框架)为基线,最佳组合(Discard-all + Verify)仅提升6.8个百分点,远低于在BrowseComp上的14.03个百分点。因为LoHoSearch需要更长的推理链,简单轨迹压缩或重启无法解决长程搜索中的信息丢失问题。

洞察四:知识图谱是系统化构造高难度题目不可或缺的基础。对比发现,BrowseComp的隐藏实体流行度更高(人工出题难以控制实体知名度),且即便控制流行度,LoHoSearch的关系搜索空间仍显著更大,实体推断难度远高于BrowseComp。

LoHoSearch的价值在于三项具体贡献:基于知识图谱的自动化构造流程突破了人工出题的难度上限;为搜索智能体建立了更具区分度的评测标尺;成为推动下一代上下文管理技术研究的理想试验场。对于开发者而言,如果你想测试自己的搜索智能体在长程推理上的真实能力,LoHoSearch是一个很好的'试金石'。同时,它的开源也提供了一个思路:利用知识图谱自动生成高难度评测数据,可以避免人工出题的主观局限。但要注意,自动生成需要严格的质量控制,否则容易混入多答案或易答题。

阅读原文 → 返回 AI 技术文档

内容与图片版权归原作者所有 · 原文: https://tech.meituan.com/2026/07/24/LongCat-LoHoSearch.html