欢迎来车东西
登录
免费注册
我的订阅
关注我们
智东西
车东西
芯东西
智猩猩
UC伯克利等发布多模态基础模型CoDi-2
2023-12-04
X
9
智东西12月4日消息,12月2日,UC伯克利博士、论文一作Zineng Tang于社交平台X发布多模态大模型CoDi-2,它可以根据复杂的多模态交错上下文指令,在零/少样本的交互方式下生成任何模态(文本、视觉、音频)。为了训练CoDi-2,来自UC伯克利、微软Azure AI等机构的团队构建了一个大规模的生成数据集,涵盖了跨文本、视觉和音频的上下文多模态指令。CoDi-2展示了广泛的零样本图像生成能力,如推理、组合性、指令编辑、示例学习和主题驱动生成等。CoDi-2还展示了音频生成的零镜头/少镜头能力,以及指令编辑和示例学习等复杂的提示。
论文地址:
arxiv.org/pdf/2311.18775.pdf
项目地址:
codi-2.github.io
UC伯克利