百灵 / inclusionAI · 高配笔记本与单卡工作站

ArmorOCR

面向低对比、旋转、编码和上下文融合等对抗性视觉文字的可定位 OCR 模型,可在原图上单次推理并输出文字区域与答案。

查看官方资料 官方源核验于 2026/08/29
参数规模约 8.77B BF16 参数
架构Qwen3-VL-8B-Instruct 微调 · Grounded Adversarial OCR
模态图像、文本、区域定位、OCR 与视觉问答
上下文官方模型卡未单独公布;不能直接沿用基座上限做部署承诺
Local deployment verdict

部署判断

8.77B BF16 权重理论下限约 17.5GB,实际还需视觉输入、KV Cache、生成输出、Transformers 与运行时工作区。官方目前未提供量化权重、统一显存或手机芯片运行数据,不能因 OCR 场景而写成可直接在移动端运行。

推荐起点
高配笔记本与单卡工作站
常见运行时
Transformers 4.57.1、Accelerate、PyTorch 2.8、官方单卡与多卡评测脚本
许可
Apache 2.0;同时受 Qwen3-VL-8B-Instruct 基座许可与使用政策约束

型号与精度版本

BF16 Safetensors

同一模型家族中的基础、指令、推理、量化或多模态检查点用途可能完全不同。下载前应核对模型卡、提示模板、分词器、量化方法和运行时版本。

适合放进哪些本地工作流

文档数字员工的异常文字复核
票据与截图的区域级 OCR
视觉输入安全评测
对抗性 OCR 研究

端侧模型更适合边界清楚、输入可控、失败可回退的任务。涉及客户承诺、财务写入、生产控制或复杂多步工具调用时,应保留云端高能力模型与人工审批作为升级路径。

进入数字员工路由前怎么测

  1. 加载测试记录具体设备、精度、运行时、上下文与首 Token 时间,避免只写“能跑”。
  2. 任务测试用脱敏企业样本测任务成功率、结构化输出和工具参数正确率。
  3. 压力测试加入长上下文、并发、热启动、内存峰值、功耗和降频观察。
  4. 治理测试验证模型许可、日志、更新、漏洞响应、人工接管与云端回退。

当前研究限制

  • AdvSpot 的准确率、IoU 与对比结果均为厂商自测,不能替代企业样本评测
  • AdvSpot 390 张基准数据截至 8 月 25 日仍标记为即将发布,当前只能获得评测脚本,外部尚无法完整复现
  • 模型专注视觉文字感知,不等于能识别提示注入意图,也不能替代权限、内容安全与人工复核
  • 官方只发布 BF16 权重且未给出统一显存、吞吐和量化数据

本页是官方资料索引与企业选型分析,不构成速度、显存、质量、许可或合规承诺。社区量化与第三方运行时应作为独立供应链组件审计。