开源视觉语言模型,将视觉编码器与 LLM 对齐实现图文理解。
访问LLaVA官网
项目简介开源视觉语言模型,将视觉编码器与 LLM 对齐实现图文理解。核心特性视觉指令微调方案可本地部署训练代码全开放获取方式通过上述官方开源仓库(通常为 GitHub)克隆或下载,按 README 安装依赖即可本地部署与二次开发。
标签:LLaVA 视觉语言 VLA 多模态
分类:开源多模态模型