L

本地推理

Local Inference

在用户设备、企业自有服务器或受控边缘环境中运行模型推理,而不是将每次请求发送给外部托管 API。

也称:离线推理、本地大模型运行、On-premise Inference

本地推理可以降低网络依赖、改善数据控制和特定场景延迟,也能让高频固定任务的边际调用成本更可控。

它并不天然更安全或更便宜。企业需要承担硬件折旧、电力、容量、运行时、模型更新、漏洞修复、日志、权限和故障回退。应以每次成功业务交付的总成本与云 API 比较。