LLaVA

3周前发布 911 0 0

LLaVA是一个大型多模态模型,旨在实现通用视觉和语言理解。它端到端训练,可以理解文本和图像,并在聊天中灵活运用这些信息。LLaVA在多模态指令跟随数据集上与GPT-4表现相似,相对分数达到85.1%。在Science QA上,其准确率达到92.53%。LLaVA模型将预训练的视觉编码器(CLIP ViT-L/14)与大型语言模型(Vic...

语言:
zh
收录时间:
2026-08-31

LLaVA是一个大型多模态模型,旨在实现通用视觉和语言理解。它端到端训练,可以理解文本和图像,并在聊天中灵活运用这些信息。LLaVA在多模态指令跟随数据集上与GPT-4表现相似,相对分数达到85.1%。在Science QA上,其准确率达到92.53%。LLaVA模型将预训练的视觉编码器(CLIP ViT-L/14)与大型语言模型(Vicuna)通过简单投影矩阵连接。训练分为两个阶段:阶段1只更新投影矩阵,基于CC3M子集进行特征对齐预训练;阶段2更新投影矩阵和大型语言模型进行端到端微调,适应日常用户导向应用和科学问答场景。

数据统计

相关导航

CoDeF

CoDeF

CoDeF通过将静态内容与时间变形结合,为视频处理提供了新的视角和工具。这种方法能够提高视频编辑和分析的效率,并具有潜力影响电影制作到虚拟现实等领域。CoDeF将视频分为规范内容字段和时间变形字段,能够精确分析和处理每一帧的内容。它还可以跟踪和分析视频中的复杂运动,实现卓越的跨帧一致性。CoDeF具有灵活性和高效性,可以应用于多种视频处理任务。 该项目由蚂蚁集团、香港科技大学和浙江大学团队共同创建。
摹小仙

摹小仙

摹小仙是由衔远科技推出的一款AI模特商拍工具,旨在为电商平台提供高效、低成本的商品展示与营销解决方案。用户可以通过摹小仙AI上传商品图片和选择相应的模特,快速生成各种服装的试穿效果图,大幅降低传统商品拍摄的成本和时间。摹小仙的提供一键生成虚拟模特、多场景切换与背景融合、自定义模特性别等多种功能,支持真人模特与虚拟模特之间的自由切换,以适应不同的电商场景。
pyvideotrans

pyvideotrans

一个功能强大且易于使用的视频翻译和配音工具,适用于需要翻译视频或为视频添加不同语言配音的人们。它的开源性质和灵活性使得用户能够根据自己的需求进行自定义和改进。 功能点: 1. 视频翻译:pyvideotrans 允许用户将一种语言的视频翻译成另一种语言。通过使用该项目,你可以轻松地转换视频的语言,使得观众能够更好地理解视频内容。 2. 配音:除了视频翻译外,pyvideotrans 还可以添加配音。你可以选择一种语言作为原始音频,然后用另一种语言的音频来替换它。这对于将视频转换成多种语言版本或为特定目标受众添加配音非常有用。 3. MIT许可证:pyvideotrans 采用了MIT许可证,这意味着用户可以免费使用、修改和分发该项目。这种开放的授权方式使得pyvideotrans 在用户和开发者之间建立了更好的互动和合作环境。