简介
Ovis 是阿里国际(AIDC-AI)开源的多模态大语言模型。它提出了”结构化视觉嵌入”的思路,通过将图像转换为与文本语义空间对齐的视觉 token,缓解了视觉与语言模态之间的鸿沟,从而提升图文理解与推理的一致性和准确性。
核心功能
- 结构化视觉对齐:把图像编码为与文本嵌入结构一致的表征,提升跨模态理解效果。
- 多尺寸系列:提供不同参数规模的模型,兼顾性能与部署成本。
- 图文推理:支持图表解读、文档理解、视觉问答等复杂多模态任务。
- 开源可商用:开放权重,便于进行二次开发与私有化部署。
对于构建多模态问答、文档理解或视觉 Agent 的开发者而言,Ovis 是一个值得尝试的开源多模态基座。