||
FaithRAG:面向忠实视频理解的检索增强生成
蔡佩妤1,高岳2
(1. 上海交通大学 自动化与感知学院,上海200240;2. 上海交通大学 计算机学院,上海200240)
摘要:由于视频上下文无关内容干扰和知识碎片化等问题,视频问答任务中模型难以生成忠于视频的可靠回答;而现有的检索增强生成相关方法虽能缓解此问题,但仍受限于信息融合能力不足,在提升视频忠实度方面存在局限。本文针对上述困境提出FaithRAG框架:面向通用视频理解构建混合超关系索引,将视频知识组织为逻辑一致的分类体系;引入视频处理策略,在保留语义连贯上下文的前提下减少多模态冗余;并构建视频忠实度评测基准VeridicalVQA与MultiGenreVideo数据集,用于系统评估答案对视频内容的忠实程度。实验结果证实:全指标两两对比下 FaithRAG 对标最优方法胜率为 58.89%,能够为视频问答方向的忠实性相关研究提供有效可行的解决思路。
关键词:视频问答,检索增强生成,知识图谱,关键凝聚帧聚类
扫二维码浏览全文

Cite this article
Tsai, P., Gao, Y. FaithRAG: Retrieval-Augmented Generation for Faithful Video Understanding. J. Shanghai Jiaotong Univ. (Sci.) (2026). https://doi.org/10.1007/s12204-026-2947-4
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-8-28 13:26
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社