SenseNova U1.5-Lite-Preview

3周前发布 711 0 0

SenseNova U1.5-Lite-Preview(或 SenseNova-U1.5-8B-MoT Preview)是商汤开源的轻量级原生统一多模态生图与编辑模型预览版

语言:
zh
收录时间:
2026-08-31
SenseNova U1.5-Lite-PreviewSenseNova U1.5-Lite-Preview

SenseNova U1.5-Lite-Preview(或 SenseNova-U1.5-8B-MoT Preview)是商汤开源的轻量级原生统一多模态生图与编辑模型预览版。用户输入自然语言长指令、单张或多张参考图,以及红框、坐标、视觉标记(Marker)等定位元素,触发模型。模型基于NEO-Unify架构,在内部将语言、视觉语义与像素生成统一建模,执行视觉理解、推理、空间规划与编辑动作。最终直接交付原生4K分辨率的复杂信息图、排版海报、图文手绘、照片及精准局部修改后的图像实体。

数据统计

相关导航

Wunjo

Wunjo

一个高级语音和Deepfake神经网络工具。功能: * 可以合成和克隆英语、俄语和中文的声音,同时支持实时语音识别。 * 能深度伪造面部和嘴唇动画,并使用一张照片进行人脸交换。 * 通过文本提示改变视频,进行分割和修饰。 * 具有语音合成、声音克隆、实时语音识别、多对话创建、视频到视频转换、深度伪造动画、AI修饰工具、自动分割掩码等功能。 * 支持英语、俄语、中文和西班牙语等多种语言。 * 适用于初学者和专业人士。 * 保护用户隐私。 * 应用于广告配音、游戏角色配音、有声书朗读和深度伪造项目等应用场景。 * 需要Python 3.10和ffmpeg作为运行环境。 * 由Wladislav Radchenko进行开发和维护。
EmojiFly

EmojiFly

一个免费开源的AI表情生成器,由开发者cbh123创建并分享在GitHub上5。这个工具的主要功能是根据用户输入的关键词,自动生成相应的表情。这个表情生成器的使用非常简单。你只需在文本框中输入你想要转换为表情的文本,网站将自动生成相匹配的表情。特别值得一提的是,这个表情生成器还支持中文 功能点如下: 1. 表情符号搜索:您可以通过关键词搜索您需要的表情符号,以满足不同的需求和场景。 2. 表情符号下载:找到合适的表情符号后,您可以将其下载到本地设备上,以便使用和分享。 3. 表情符号添加:下载的表情符号可以添加到Slack等应用程序中,让您在聊天中更加生动和有趣。 4. 特色表情符号:EmojiFly提供一些特色的表情符号供您选择,这些符号可能具有一些特定的主题或表达方式。
StyleTTS 2

StyleTTS 2

一个开源的文本转语音工具,其表现可以媲美Elevenlabs。它具有以下特点: 1. 能够自动生成多种不同的语音风格,无需依赖特定的参考语音。 2. 采用特殊的训练方法,使得生成的语音更加贴近真人的说话方式。 3. 利用扩散模型技术,高效地生成不同风格的语音。 4. 提供对语音的精确控制,包括语速、语调等方面。 5. 在测试中,生成的语音质量接近于真人录音。即使没有特定说话者的样本,也能生成高质量的语音。 StyleTTS 2的工作原理是通过风格扩散和与大型语音语言模型的对抗性训练来实现接近人类水平的TTS合成。这个模型与其前身不同之处在于,它通过扩散模型将风格建模为一个潜在的随机变量,以生成最适合文本的风格,而不需要参考语音。此外,StyleTTS 2采用非自回归架构,它在生成语音时不需要依次预测每个音频样本,而是可以并行生成整个语音序列。这种方法大大提高了语音合成的速度。 StyleTTS 2在多个评估结果方面表现出色: 1. 在多个测试中,StyleTTS 2生成的语音质量非常高,接近或达到了真人录音的水平。这表明了其在模仿人类语音方面的高效能力。 2. 在LJSpeech数据集
ComfyUI Portrait Master

ComfyUI Portrait Master

ComfyUI Portrait Master 肖像大师 简体中文版是一款专业的人物肖像提示词生成工具。它专注于优化肖像生成,让选择比填空更适合人类的操作方式。这款工具可以根据用户的具体需求,生成各种肖像的提示词,覆盖镜头类型、性别、国籍、面部表情、发型等多个参数。用户可以根据自己的需求进行个性化设置,例如调整发型、表情等。此外,此工具适用于多种工作流程,广泛应用于视频制作和设计等领域。目前最新版本为2.2,经过优化和汉化处理,ComfyUI Portrait Master项目为使用者提供了更加便捷的使用体验。如果你对此感兴趣,可以到项目官网学习使用方法,网上也有详细的教程可供参考。 使用参考:https://zhuanlan.zhihu.com/p/663008600
Deep Chat

Deep Chat

一个可定制的 AI 聊天组件,能够轻松地将 AI 聊天机器人嵌入到任何网站中。它支持多媒体交互、音频和视频捕捉、语音到文本和文本到语音等功能,并且界面高度可定制。Deep Chat 可以集成到各种现代网页框架中,如 React、Vue、Angular 等,是一个全面、多功能的聊天解决方案。作为一个开源项目,您可以根据需要修改源代码,或者参与到社区中,以贡献新的功能或改进。