免费、绿色、专业的手机游戏中心下载安装平台-游家吧

当前位置: 首页 > 教程攻略 > 首个开源多模态 Deep Research 智能体,超越多个闭源方案

首个开源多模态 Deep Research 智能体,超越多个闭源方案

更新时间:2026-07-21 22:21:40

欢视tv最新版app v1.0.1
  • 类型:
  • 大小:36.7m
  • 语言:简体中文
  • 评分:
查看详情

首个开源多模态 Deep Research 智能体,超越多个闭源方案

研究团队 投稿

量子位 | 公众号 QbitAI

首个开源多模态 Deep Research Agent 来了。

我开发了一款强大的智能助手应用。它能够整合网页浏览、图像搜索、代码解释器以及内部OCR等多项工具功能。通过全自动流程,该应用生成高质量的推理轨迹,并利用冷启动微调和强化学习技术优化决策过程,使模型在任务中能自主选择最合适的工具组合与推理路径,从而提升工作效率。

假设你让一个 AI 回答这样一个问题:

" 在这张图所示动物的 Wikipedia 页面上,2020 年之前带有 ‘ visual edit ’ 标签的修订次数是多少?"

听起来不复杂,但要得到正确答案,需要经过多个环节:

- 从图像中识别出动物(它是一只海鹦 Atlantic puffin,而不是外形相似的鹈鹕、企鹅或海鸥)。

- 找到对应的 Wikipedia 页面并进入历史版本记录。

- 筛选出 2020 年之前带有 "visual edit" 标签的版本,并进行精确计数。

从上例中可窥见,此类挑战需辅以制定计划的能力、灵活运用各类工具及适时修正方向的推理技能。

这类跨模态、跨工具、多步骤的任务,需要具备深度研究(Deep Research)能力的 Agent 才能有效应对。

WebWatcher 的核心方法

新版本:WebWatcher的技术方案涵盖了从数据生成到模型训练的全链条,旨在使多模态智能代理在复杂多模态深度学习挑战中拥有强大的灵活性和协同作业的能力。该方法主要由三个关键步骤构成:数据预处理、模型训练优化以及模型应用效果评估。

- 多模态高难度数据生成:构建具备复杂推理链和信息模糊化的训练数据;

在高质量推理轨迹构建与后训练中,我们采用了生成贴近真实多工具交互的推理轨迹的方法。首先,通过监督微调(SFT),我们完成了模型的初步能力对齐。然后,利用GRPO在复杂任务环境中进一步提升模型的决策能力和泛化性。

- 高难度基准评测:构建并使用 BrowseComp-VL 对模型的多模态深度推理能力进行验证。

- 多模态高难度数据生成

随着技术的发展,现有的VQA(Visual Question Answering)数据集主要聚焦于单一步骤感知任务,缺乏规划性和深度推理的需要,这限制了多模态深度研究代理的训练。为了弥补这一不足,我们的研究团队设计了一个全自动多模态数据生成流程,目标是在真实互联网知识分布下生成复杂、跨模态和链路不确定的任务样本。这个流程能够提供高度多样化的任务数据,为模型在实际应用中的泛化能力提升提供了强有力的支撑。

随机游走收集跨模态知识链

研究团队在多种类型网页(如文本、图片和混合页面)中进行随机游走采样,并构建了多领域实体图谱。与传统的线性多跳问答链不同,这种图谱连接密集且路径不确定,问题解决的路线难以预设。因此,模型需要探索性的结合视觉信息来解决问题。

信息模糊化提升不确定性

在生成问题时,研究团队刻意隐藏关键信息(如将 替换为 纪初、将实体名改为描述性短语),并在视觉部分引入模糊指代词描述,从而防止模型依赖简单模式匹配,并要求其进行跨模态推理。

文本 - 视觉联合转换

通过 QA-to-VQA 转换模块,所有复杂问题(QA)样本被转化为多模态版本,使其自然地依赖于跨模态理解和推理能力,从而简化复杂的语言处理任务。

经过多阶段过滤,包括语义合理性检查、视觉相关性验证和推理链长度控制,研究团队创建了一个大型且质量高的多模态推理数据集,涵盖各种复杂的推理类型。

- 高质量推理轨迹构建与后训练

通过深度学习技术的应用,在高难度训练数据基础上,模型需要学习调用多种工具以及在推理过程中实时选择最优策略的能力。然而,现有的推理模型在处理长链条涉及多个工具的任务时遇到了两大挑战。

- 思维链条冗长、模板化,缺乏跨任务的适应性;

- 工具调用格式和角色差异大,直接采集到的轨迹难以直接用于训练。

为此,研究团队提出了Action-Observation 驱动的轨迹生成方法:

收集真实的多工具交互轨迹;

采用 Action-Observation 结构,简化至紧凑的步骤指导,摒弃烦琐和泛化的解释方式。

使用规则过滤与 LLM 辅助审查,剔除低质量轨迹。

研究人员利用高质量轨迹对WebWatcher进行监督微调(SFT),帮助其在初期快速掌握多模态ReAct式推理与工具调用的基础知识,为后续强化学习阶段奠定坚实基础。

完成冷启动后,WebWatcher进入强化学习阶段,运用GRPO进一步增强其在复杂环境下的决策能力。模型严格结合格式正确性与答案准确性双重标准设计奖励机制,对多步工具调用的连贯性和最终答案的准确度给予高度关注,从而提升多模态决策链的可靠性。

- BrowseComp-VL:多模态深度研究基准

为深入测试WebWatcher功能,研究者开发了BrowseComp-VL,在视觉-语言领域挑战专家级难度的研究课题上提供了接近的模拟。

该基准具有以下特点:

- 长期任务依赖模糊识别和多源数据整合:涉及多个不确定的实体,需跨平台、跨模态检索。

在多工具协作中,重要的是将多种功能集成在一起,以高效地处理复杂的任务。这包括使用网页浏览器、图像识别技术(如OCR)和自动化脚本来提高工作效率,而不仅仅是依赖单一的文本搜索或认知感知工具。

- 真实网络环境:测试样本来自真实网页与图像资源,保持复杂性与不可预测性。

实验结果:刷新多模态推理与信息检索新纪录

通过广泛且严格的测试,WebWatcher在全球四大关键领域的表现超越了所有现有流行的开源和闭源多模态大规模模型,展示出强大的功能,特别是在复杂的推理、信息检索、知识整合及优化查询等方面的能力。

复杂推理(HLE-VL)

WebWatcher 在“人类终极考试”(HLE-VL)这一复杂的多步推理基准上表现卓越,取得了的Pass@数,显著超越GPT-Geminiflash和QwenVL-等同侪模型。这种性能验证了其在处理高难度知识整合与链式决策方面的能力。

信息检索能力(MMSearch)

在MMSearch评测中,WebWatcher的表现同样出色,Pass@分高达,超越了Geminiflash的和GPT-的,突显出其卓越的信息检索能力和复杂场景下信息聚合能力。

知识 + 检索整合(LiveVQA)

LiveVQA 是一种结合知识推理和外部信息获取深度协同的典型场景,它展示了WebWatcher在多个维度上的卓越性能。根据最新的测试数据,WebWatcher的Pass@绩达到了,这是超越了Geminiflash、QwenVL-和GPT-的成绩,充分显示了其在知识调用、事实核查与实时信息融合等多方面技能上的强大系统能力。

信息寻优与聚合(BrowseComp-VL)

在BrowseComp-VL基准测试中,WebWatcher以的平均得分(Pass@远远领先于GPT-)、Geminiflash、QwenVL-和Claude-国内外顶级旗舰模型,其性能提升了约一倍。此基准涉及跨网页、多实体和模糊表达等多种严苛挑战,充分展现了WebWatcher在复杂信息寻优与聚合领域的强大能力优势。

综合分析,WebWatcher 在单一任务上表现出色,并且在复合型任务、跨模态复杂推理以及现实信息检索方面取得了显著优势,从而确立了其作为新一代开源多模态智能代理的领军地位。

arxiv:https://arxiv.org/abs/2508.05748

github 仓库:https://github.com/Alibaba-NLP/WebAgent

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

点亮星标

科技前沿进展每日见

以上就是首个开源多模态 Deep Research 智能体,超越多个闭源方案的详细内容,更多请关注其它相关文章!

精品推荐

相关文章

最新资讯

热门文章

更多