HybridDeepResearch:首个混合深度研究基准揭示AI智能体跨模态整合瓶颈

深度研究智能体的现实困境
近年来,自主智能体(autonomous agents)在"深度研究"领域取得了长足进步。自主智能体是指能够感知环境、做出决策并自主执行行动以达成目标的AI系统——与传统的单轮问答模型不同,这类智能体具备多步推理、工具调用和环境交互能力。在"深度研究"场景中,它们通常采用ReAct(Reasoning + Acting)或类似的思维-行动循环框架,能够自主决定下一步该搜索什么、该查询什么、如何综合已获取的信息。
ReAct框架由普林斯顿大学和Google DeepMind于2022年提出,是当前主流智能体架构的理论基础。其核心思想是让大语言模型在推理过程中交替进行"思考"(Thought)和"行动"(Action)两个阶段:思考阶段模型分析当前状态并规划下一步策略,行动阶段模型调用外部工具(如搜索引擎、代码执行器、数据库接口)获取新信息,然后基于观察结果(Observation)进入下一轮思考-行动循环。这种设计使得模型能够动态调整策略,而非一次性给出答案。在ReAct之后,社区又发展出了Reflexion(加入自我反思机制)、LATS(结合蒙特卡洛树搜索)、Plan-and-Solve(先规划再执行)等变体框架,形成了丰富的智能体架构生态。
OpenAI的Deep Research、Google的Gemini Deep Research等产品都是这一方向的代表。它们能够迭代式地浏览开放网络,综合来自不同网页的信息,最终形成对复杂问题的回答。然而,真实世界的问题求解从来不会局限于单一环境。
来自Snowflake AI Research的最新论文《Benchmarking Hybrid Deep Research Across Database Querying and Web Search》(arXiv:2609.09410)指出了一个关键问题:复杂的分析任务本质上要求智能体能够将来自模糊的非结构化文本(如开放网络)和高度精确的结构化数据(如关系型数据库)的证据编织在一起。
这里有必要理解两类数据的本质差异:结构化数据是按照预定义模式(schema)组织的数据,典型代表是关系型数据库中的表格数据,可以通过SQL进行精确查询,返回的结果具有确定性和可重复性。非结构化数据则包括网页文本、新闻文章、社交媒体帖子等,它们没有固定格式,信息密度不均匀,且往往包含歧义、冗余和噪声。SQL查询返回的是精确匹配的记录,而网络搜索返回的是按相关性排序的近似结果——这种本质差异正是混合推理任务的难点所在。
在企业数据架构中,结构化数据与非结构化数据的融合一直是数据工程领域的核心挑战。传统的数据仓库(Data Warehouse)主要处理结构化数据,而数据湖(Data Lake)则试图统一存储各类数据。近年来兴起的"湖仓一体"(Lakehouse)架构——以Snowflake、Databricks等平台为代表——正是为了弥合这一鸿沟。值得注意的是,本文的研究团队来自Snowflake AI Research,这家公司本身就是云数据平台的领导者,其研究动机很可能直接来源于客户在实际业务中遇到的痛点:分析师需要同时查询Snowflake中的结构化数据和外部非结构化信息源,但现有的AI助手无法可靠地完成这种跨模态任务。
现实中的分析师每天都在做这样的事情——他们既要查询公司数据库获取精确的交易记录,又要在网络上搜索背景信息、新闻和行业动态,然后将两类信息整合成一个完整的结论。但现有的评测基准却将这两种模态孤立地进行评估,无法捕捉到其中最关键的"交接"(handoff)环节。

什么是智能体的"交接"能力?
研究团队强调的"交接"能力,指的是在不同系统之间移动证据时保持约束条件的能力。这是一个被以往研究严重低估的挑战。
举个例子:假设你需要回答"我们公司去年营收排名前三的产品,在社交媒体上的舆论评价如何?"这个任务就要求智能体首先通过SQL查询数据库找出"营收前三的产品"(结构化数据),然后带着这个精确的约束条件去网络上搜索相关评价(非结构化数据)。
在这个过程中,智能体必须准确地把数据库查询出的产品名称传递到网络搜索环节,不能丢失、篡改或模糊化这些约束。这个问题可以类比于软件工程中的"数据管道"概念——在多步推理中,每一步的输出都是下一步的输入,任何一个环节的信息损耗都会沿链条传播甚至放大,类似于信号处理中的噪声累积效应。在智能体系统中,信息损耗的典型表现包括:模型在将SQL查询结果转化为搜索关键词时丢失了精确的数值约束(如"营收前三"变成了"高营收")、实体名称在传递过程中发生微妙变形(如缩写展开或拼写变化)、时间范围等限定条件在跨步骤传递时被遗忘。
这类问题的根源在于当前大语言模型依赖自然语言作为中间表示,而自然语言天然具有模糊性,不像程序语言那样能精确保持语义不变。从信息论的角度理解,自然语言是一种高度压缩且有损的编码方式——同一句话可以有多种解读,而结构化数据中的精确数值和实体标识在经过自然语言"编码-解码"过程后,不可避免地会引入噪声。这与香农信息论中"有损信道"的概念类似:当信息通过一个不完美的信道传输时,部分信息会不可逆地丢失。一旦在"交接"过程中出现信息损耗,整个答案就会偏离正确方向。这正是当前AI智能体系统所面临的核心难题。
HybridDeepResearch 基准的设计详解
为了系统性地评测这一能力,研究团队提出了 HybridDeepResearch——据他们所知,这是首个同时要求网络搜索和SQL查询才能形成完整、可验证答案的深度研究基准。
数据规模与构建方式
该基准包含 380个工具依赖型任务,这些任务基于 LiveSQLBench-Base-Lite 数据库和公开的网络语料库构建。LiveSQLBench是一个专门用于评估大语言模型SQL生成能力的基准测试集,使用真实世界的数据库场景来测试模型将自然语言问题转化为正确SQL查询的能力。
Text-to-SQL(自然语言转SQL)是自然语言处理领域的经典任务,其发展历程为理解本研究提供了重要背景。这一领域经历了从早期规则匹配、到Seq2Seq模型、再到预训练语言模型微调的演进路径。经典的评测基准包括WikiSQL(单表简单查询)、Spider(跨数据库多表复杂查询,由耶鲁大学于2018年提出)和BIRD(引入外部知识的真实世界查询)。LiveSQLBench在此基础上强调"活态"评测——使用持续更新的数据和场景来防止模型在训练数据中"记住"答案(即数据污染问题),从而更真实地反映模型的泛化能力。HybridDeepResearch在此基础上进行了创新性扩展,将SQL查询任务与网络搜索任务耦合在一起,这种跨模态耦合在以往的基准中尚未出现。
所有任务都经过了自动化检查与人工审核的双重验证——自动化检查确保每个任务确实需要两种工具才能完成(而非仅用一种工具就能回答),人工审核则验证答案的正确性和任务描述的清晰性。380个任务的规模在研究性基准中属于中等,但由于每个任务都需要跨模态推理,其评测价值远高于简单扩大数据量。
三种核心推理模式
基准覆盖了三种不同的推理模式,这是其设计的精髓所在:
- SQL2S(SQL到搜索):先进行SQL查询,再带着结果去网络搜索(从结构化到非结构化的定向推理)
- S2SQL(搜索到SQL):先进行网络搜索,再将结果用于SQL查询(从非结构化到结构化的定向推理)
- Parallel(并行模式):并行地从两个信息源获取证据,最后进行交叉验证
这三种模式的区分非常重要,因为它们分别代表了不同难度和不同类型的跨模态整合挑战。SQL2S要求模型在获得精确的数据库结果后,能够将其有效地转化为网络搜索策略——这涉及将结构化的查询结果"翻译"为有效的搜索关键词组合,需要模型理解哪些信息是搜索引擎可以处理的、哪些约束需要通过特定的搜索策略来表达;S2SQL则要求模型从模糊的网络信息中提取出足够精确的条件来构造SQL查询——这本质上是一个信息提纯过程,模型需要从充满噪声的网页文本中识别出可以作为SQL WHERE子句条件的精确值;而Parallel模式考验的是模型同时管理两条独立信息流并最终进行交叉验证的能力,这类似于分布式系统中的"最终一致性"挑战。
顶级模型也仅过半:评测结果深度剖析
研究团队在专有模型和开源权重模型上,使用多种智能体框架(agentic scaffolds)进行了广泛的评测。智能体框架是指围绕大语言模型构建的系统性架构,它定义了模型如何感知环境、规划行动、调用工具和整合结果。这些框架通常包含几个核心组件:任务规划器(将复杂问题分解为子任务)、工具调用接口(连接搜索引擎、数据库等外部系统)、记忆模块(维护对话历史和中间结果)以及反思机制(评估当前进展并调整策略)。不同的框架设计会显著影响智能体的表现,例如是否支持回溯、是否能动态调整计划、工具调用的粒度等都是关键设计选择。当前主流的框架包括LangChain的Agent模块、AutoGen的多智能体协作框架、以及CrewAI的角色化智能体系统等,它们在工具编排和上下文管理策略上各有侧重。
评测结果令人深思。即便是当前最先进的模型——如 GLM-5.2、Claude-Sonnet-4.6 和 GPT-5——在困难子集上的 Pass@8 也仅达到约 50-54%。
Pass@k是源自代码生成领域的评测指标,最初由OpenAI在Codex论文中广泛使用。它表示在k次独立尝试中至少有一次成功的概率。其精确的数学定义涉及组合概率:假设对一个问题生成n个独立样本,其中c个是正确的,则Pass@k = 1 - C(n-c, k)/C(n, k)。这个指标之所以在智能体评测中被采用,是因为它能更好地反映模型的"能力上界"——即在最佳情况下模型能否解决问题。与之对比的是Pass@1(单次成功率),反映的是模型的"期望表现"。Pass@8约为50-54%意味着,即使给模型8次独立生成答案的机会(每次可能采取不同的推理路径和工具调用策略),也只有约一半的困难任务能被至少解决一次。两个指标之间的差距越大,说明模型的输出方差越大、稳定性越差。根据粗略估算,Pass@1可能只有15-25%左右,这意味着在实际部署中(通常只执行一次),大多数困难的混合推理任务都无法被正确完成。
这个数字清晰地表明,尽管单项能力(无论是纯网络搜索还是纯SQL查询)已经相当成熟,但将两者有效结合仍然是一道难以逾越的门槛。
定向推理比并行交叉验证更难
一个特别值得注意的发现是:定向推理(directional reasoning)明显比并行交叉(parallel intersection)更困难。
这意味着 SQL2S 和 S2SQL 这类需要严格顺序、需要将一个环节的精确输出作为下一个环节输入的任务,对智能体构成了更大的挑战。相比之下,并行获取证据后再做交集的任务反而相对容易。
其背后的逻辑不难理解:在定向推理中,前一步的约束必须被完整无损地传递到后一步,任何信息损耗都会沿着推理链放大——这在复杂系统理论中被称为"级联失败"(cascading failure),一个环节的小偏差可能导致下游环节的严重错误。级联失败的概念源自网络科学,最初用于描述电力网络中一个节点故障如何引发大规模停电。在AI智能体的多步推理链中,级联失败呈现出独特的模式:错误不仅会传播,还会在语言模型的"幻觉"倾向下被放大。例如,当SQL查询返回了一个智能体不熟悉的实体名称时,模型可能在后续步骤中"修正"这个名称为它认为更合理的形式(即幻觉),导致搜索方向完全偏离。这种现象可以理解为"确认偏误的计算类比"——模型倾向于生成与其先验知识一致的输出,而非忠实传递上游步骤的精确结果。
而并行模式下,两个信息源相对独立,最后只需做交集验证,容错空间更大。这一发现也与人类认知科学中的研究一致:顺序依赖的推理任务往往比可以并行处理的任务更容易出错,因为工作记忆需要在步骤间精确维护上下文信息。心理学家George Miller在1956年提出的"神奇数字7±2"理论指出人类工作记忆容量有限,而大语言模型虽然拥有远超人类的上下文窗口,但在多步推理中对关键约束信息的"注意力分配"同样面临类似的瓶颈——随着推理步骤的增加,早期步骤中的关键信息在注意力机制中的权重会逐渐衰减。
对AI智能体行业的实践启示
这项研究揭示了当前智能体系统的一个根本性短板:在不损失约束条件的前提下,跨越结构化与非结构化信息空间,仍然是智能体系统面临的一大未解难题。
对于正在构建企业级AI应用的团队而言,这一发现具有重要的实践意义。许多企业场景(商业智能分析、合规审查、市场研究等)本质上都是混合型任务,既需要查询内部数据库,又需要检索外部信息。以合规审查为例,审查人员需要从内部交易数据库中识别异常交易模式(结构化查询),然后在监管公告、新闻报道和行业指引中确认这些模式是否构成违规(非结构化检索),最后将两者综合形成审查意见。类似的场景还出现在金融领域的尽职调查(due diligence)中——分析师需要交叉比对公司财务数据库中的财务指标与公开市场信息、新闻报道和诉讼记录,任何一个环节的信息遗漏都可能导致严重的投资决策失误。如果智能体在"交接"环节频繁出错,那么它在这些高价值场景中的可靠性就值得怀疑。
这也为未来的研究方向指明了道路:如何设计更鲁棒的约束传递机制、如何在多工具调用之间保持上下文一致性,将成为智能体研究的重要课题。潜在的解决方案可能包括:引入形式化的中间表示语言替代自然语言进行跨步骤信息传递——例如使用JSON-LD或知识图谱三元组作为步骤间的信息载体,以消除自然语言的歧义性;设计专门的约束验证模块在每次"交接"时检查信息完整性——类似于软件工程中的"断言"(assertion)机制,在运行时验证数据是否满足预期条件;以及利用强化学习训练智能体在多步推理中更好地保持约束一致性,其中奖励函数可以显式地惩罚跨步骤的信息损耗。此外,检索增强生成(RAG)领域中正在发展的"结构化RAG"方法——将检索结果以结构化形式存储和传递而非简单拼接为文本——也可能为这一问题提供启发。
开放资源与社区参与
值得肯定的是,研究团队秉持开放精神,将代码和数据集完全公开:
- GitHub:https://github.com/Snowflake-AI-Research/HybridDeepResearch
- Hugging Face:https://huggingface.co/datasets/Snowflake/HybridDeepResearch
这为社区进一步研究混合深度研究任务、改进智能体的跨模态整合能力提供了宝贵的基础设施。开放基准在AI研究中具有重要的催化作用——正如ImageNet(2009年由李飞飞团队创建,包含1400万张标注图像)推动了计算机视觉的快速发展、SQuAD(斯坦福问答数据集,2016年发布)推动了阅读理解能力的提升、GLUE和SuperGLUE推动了自然语言理解的进步一样,HybridDeepResearch有望成为推动混合推理智能体进步的关键标杆。开放基准的价值不仅在于提供评测工具,更在于它为社区定义了一个共同的研究目标和可比较的进展度量标准。随着越来越多的研究者在这一基准上进行评测和优化,我们有理由期待下一代智能体能够真正胜任那些需要融合多源信息的复杂现实任务。
核心要点
核心要点
相关推荐

LTX2.5开源本地部署实测:AMD显卡最低8G显存跑视频生成
开源视频生成模型 LTX2.5 本地部署实测:AMD 7900XTX 显卡在 Windows 11 环境下最低 8G 显存可运行,2 分钟生成 5 秒视频。附五套工作流对比与整合包、手动部署教程。

ComfyUI双语提示词节点实测:不懂英文也能玩转标签
一位B站UP主借助GPT打造的ComfyUI双语标签提示词拓展节点实测:中英标签双向联动、30万词库支持、未知标签一键翻译沉淀,让不懂英文的小白也能玩转提示词,目前适配anima本地部署模型。

16G显存跑Qwen3 27B:192K上下文+视觉实测
在16G显存显卡上部署Qwen3 27B模型,通过llama.cpp Adaptive KV Streaming实现192K超长上下文与视觉能力。本文详解KV缓存瓶颈原理、量化版本选择及RTX 5080实测速度与任务能力。