ERNIE-4.5-VL是什么
ERNIE-4.5-VL是百度文心开源的新一代多模态AI模型,基于ERNIE-4.5-VL-28B-A3B架构,激活参数3B,主打视觉语言理解与跨模态推理。模型通过海量视觉-语言数据训练强化语义对齐,并采用多模态强化学习提升稳定性,新增视觉定位与”图像思考”功能,支持文档解析、视频分析等场景。模型支持2-Bit无损量化和128K超长上下文窗口,优化了显存占用和推理速度,能处理超长文本内容。
ERNIE-4.5-VL的主要功能
- 多模态理解与生成:ERNIE-4.5-VL 能同时处理文本和图像信息,实现图像描述生成、图文问答、图像分类等功能,支持多模态内容的综合理解和创作。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
