首页 > 计算机科学

别再让AI“只看不搜”,真正解决问题需要它自己去查资料

数据派THU 2026-01-28 17:00
文章摘要
背景:现有的多模态模型在视频问答任务中通常局限于视频内容本身,缺乏结合外部信息进行深度推理的能力,这与人类“观看-搜索-综合”的真实问题解决模式存在差距。研究目的:为了评估AI模型结合视频线索与网络搜索进行多跳推理的能力,研究团队推出了首个视频深度研究评测基准VideoDR,旨在推动能进行开放网络深度研究的智能视频代理的发展。结论:评测显示,Gemini-3-pro-preview和GPT-5.2等闭源模型表现领先,但“端到端”的代理模式并非万能,在长视频或复杂任务中易出现目标漂移和记忆衰退;工作流模式因具有显式中间文本作为外部记忆而展现出优势。未来的视频智能体需在保持长程视觉一致性上取得突破。
别再让AI“只看不搜”,真正解决问题需要它自己去查资料
本站注明稿件来源为其他媒体的文/图等稿件均为转载稿,本站转载出于非商业性的教育和科研之目的,并不意味着赞同其观点或证实其内容的真实性。如转载稿涉及版权等问题,请作者速来电或来函联系。
最新文章
DeepSeek 双创新,OCR2 会 “读” 文档,mHC 改写残差十年规则
DeepSeek 双创新,OCR2 会 “读” 文档,mHC 改写残差十年规则
本文约2600字,建议阅读5分钟本文介绍了 DeepSeek OCR2 模型与 mHC 新思路的核心技术创新。DeepSeek一直带有原创性,总是会给大家一些新的启发和思路。昨天DeepSeek发布了
10小时前
实操干货 LangGraph 多智能体工作流的设计与运行全解析
实操干货 LangGraph 多智能体工作流的设计与运行全解析
来源:DeepHub IMBA本文约4000字,建议阅读8分钟本文介绍了 LangGraph 的核心设计、运行机制及典型应用与适用场景。LangGraph 设计的一个核心是:多智能体工作流本质上是图结
10小时前
刷屏 Nature!人类终于读懂 98% 的基因暗物质
刷屏 Nature!人类终于读懂 98% 的基因暗物质
来源:新智元本文约2600字,建议阅读5分钟本文介绍了谷歌 AlphaGenome 登 Nature 封面,破解 98% 基因非编码区并精准预测基因突变影响。[ 导读 ]生命,是一场长达40亿年代码迭
2026-02-07
别再乱喂 prompt 了!Claude Code 这么用才对
别再乱喂 prompt 了!Claude Code 这么用才对
来源:DeepHub IMBA本文约1200字,建议阅读5分钟本文介绍了 Claude Code 子代理的用法、10 个实用模板及核心提效逻辑。如果你认为Claude Code 的使用流程就是随手丢一
2026-02-07
Book学术官方微信
Book学术文献互助
Book学术文献互助群
群 号:604180095
Book学术
文献互助 智能选刊 最新文献 互助须知 联系我们:info@booksci.cn
Book学术提供免费学术资源搜索服务,方便国内外学者检索中英文文献。致力于提供最便捷和优质的服务体验。
Copyright © 2023 Book学术 All rights reserved.
ghs 京公网安备 11010802042870号 京ICP备2023020795号-1