CoDeF
CoDeF通过将静态内容与时间变形结合,为视频处理提供了新的视角和工具。这种方法能够提高视频编辑和分析的效率,并具有潜力影响电影制作到虚拟现实等领域。CoDeF将视频分为规范内容字段和时间变形字段,能够精确分析和处理每一帧的内容。它还可以跟踪和分析视频中的复杂运动,实现卓越的跨帧一致性。CoDeF具有灵活性和高效性,可以应用于多种视频处理任务。 该项目由蚂蚁集团、香港科技大学和浙江大学团队共同创建。
LLaVA是一个大型多模态模型,旨在实现通用视觉和语言理解。它端到端训练,可以理解文本和图像,并在聊天中灵活运用这些信息。LLaVA在多模态指令跟随数据集上与GPT-4表现相似,相对分数达到85.1%。在Science QA上,其准确率达到92.53%。LLaVA模型将预训练的视觉编码器(CLIP ViT-L/14)与大型语言模型(Vicuna)通过简单投影矩阵连接。训练分为两个阶段:阶段1只更新投影矩阵,基于CC3M子集进行特征对齐预训练;阶段2更新投影矩阵和大型语言模型进行端到端微调,适应日常用户导向应用和科学问答场景。


