7月17日,2026世界人工智能大会(WAIC)开幕,当虹科技现场展出视频AI Agent交互系统。体验者仅需用自然语言描述需求,如“我想看哪吒、敖丙共渡天劫的片段”,系统即刻识别并播放对应视频画面及精确时间点。
该技术突破传统视频搜索依赖片名、关键词或手动拖拽进度条的限制,支持基于演员、台词、场景等模糊记忆的语义检索,例如“我想看《狂飙》最后一集”“帮我找张艺谋的最新电影”等指令均可快速响应。观看过程中,用户还能就画面内容实时提问,实现“边看边聊”。
当虹科技工作人员指出,视频包含人物、场景、动作、音乐、字幕等多模态信息,理解难度高于纯文本。其视频AI Agent融合多维内容理解与多轮语义交互能力,可深度解析事件、人物及上下文关系,将“文本搜视频”升级为“与视频直接对话”。依托公司在视听传媒领域的技术积累及与内容平台的生态合作,模型持续优化理解与检索精度。
该技术重新定义人与视频的交互逻辑:视频不再仅为被动播放载体,而成为可理解、可检索、可调用的信息空间。人物、场景、事件等均转化为结构化信息单元,用户面对的是具备内容认知能力的智能交互入口。
现场观众反馈称该方式更契合日常习惯,尤其适用于记不清片名但记得剧情的用户;亦有观点提出未来可结合情绪状态实现个性化推荐。目前,该视频AI Agent已落地智能座舱场景,支持车主在驻车状态下通过语音获取指定视频片段,提升碎片化时间娱乐体验。
免责声明:本文内容由开放的智能模型自动生成,仅供参考。



