【光熙博士生学术论坛讲座】
讲座人:王霄 博士生
题目:用于长视频理解的自适应冗余压缩方法
时间:2026年9月21日15: 00-16: 00
地点:L1118
讲座内容:
随着多模态大语言模型的快速发展,视频理解能力取得了显著进步,但其上下文长度仍受制于巨大的冗余信息和有限的算力资源。在长视频场景下,冗余帧和层级信息造成计算与存储开销过高,成为进一步扩展模型能力的关键瓶颈。针对这一问题,我们提出了训练无关的自适应冗余压缩方法AdaReTaKe。该方法通过在时间维度上利用帧间相似度动态分配压缩率,并在层级维度上结合注意力分布灵活调整预算,从而在保持关键信息的前提下显著减少无效冗余。理论分析表明,该机制能够有效控制压缩误差上界,确保信息完整性。大量实验验证了其有效性,AdaReTaKe将模型的可处理长度从256帧提升至2048帧,并在VideoMME、MLVU、LongVideoBench和LVBench等多个长视频基准上均取得大幅提升,在7B模型上平均提高2.3%,在72B模型上平均提高2.8%,其中在LVBench上的增幅接近6%。这一工作展示了在有限计算成本下提升长视频理解能力的新路径,为未来多模态模型在更长时序和复杂场景中的应用提供了坚实的基础。