端侧多模态模型
On-device Multimodal Model
在手机、AI PC、工作站或企业边缘环境本地处理文本、图像、视频或音频中至少两种模态的模型。
也称:本地多模态模型、端侧视觉语言模型、端侧 VLM、Local Multimodal Model
端侧多模态模型让图像、视频、语音和文字不必先发送到外部云服务,适合本地文档理解、截图问答、会议转写、现场巡检和离线助手。
它的资源占用不能只按语言模型参数估算。视觉编码器、语音编码器、图像分辨率、视频帧数、音频时长、模态投影组件和 KV Cache 都会增加真实内存与延迟。
企业评估时应为每种模态分别固定输入规格,并测量任务成功率、峰值内存、首个结果时间和连续运行稳定性。