企业让数字员工读取合同、发票、银行回单、网页截图和扫描表格时,常把 OCR 当成确定性的预处理:图片转成文字,再交给大模型理解。但视觉文字并不总是规整印刷体。低对比度、旋转、镜像、点阵、图案叠加或与背景融合的文字,人能辨认,模型却可能漏读、错读,甚至只回答内容而无法指出文字来自哪个区域。
百灵 inclusionAI 与蚂蚁研究团队在 2026 年 8 月 20 日公开 ArmorOCR 权重、推理代码和论文。它把问题定义为“可定位的对抗性 OCR”:模型不只输出识别结果,还要定位原图区域。对企业而言,价值不在于多一个 OCR 排名,而在于提醒我们:进入数字员工上下文的每段文字都应有可回溯证据,视觉识别也需要异常检测、交叉验证和失败关闭。
官方事实:单次原图推理,但不是轻量移动模型
官方模型卡显示,ArmorOCR 基于 Qwen3-VL-8B-Instruct 微调,在原图上单次推理,不依赖运行时裁剪、放大或额外工具。Hugging Face 权重元数据约为 8.77B BF16 参数,采用 Apache 2.0;模型卡同时注明还要遵守 Qwen3-VL-8B-Instruct 基座模型的许可与使用政策。
“单次推理”描述的是处理流程,不代表低内存。按 BF16 粗算,8.77B 权重理论下限约 17.5GB,实际还要容纳视觉 Token、KV Cache、生成输出、Transformers 和运行时工作区。官方当前没有发布量化检查点,也没有给出统一显存、吞吐或手机芯片数据。因此 ArmorOCR 型号页把它归入高配笔记本与单卡工作站,而不是因为名称里有 OCR 就自动写成端侧手机模型。
厂商自测:AdvSpot 解决了什么,又缺了什么
论文提出 AdvSpot 基准,共 390 张带区域标注的图像,覆盖 5 个大类、13 种细粒度对抗性文字。任务同时考查转录、区域定位、完整 spotting 和区域视觉问答。ArmorOCR 通过两阶段训练把经过视觉变换的“特权观察”蒸馏回原图推理,再用任务奖励优化定位与识别。
论文报告的准确率、IoU 和相对基座提升都属于厂商研究条件下的自测。更重要的限制是:截至 8 月 25 日,官方仓库已经提供 advspot_infer.py,但 390 张 AdvSpot 数据仍标记为“Coming Soon”。外部团队目前无法用完整原始基准独立复现论文表格。企业可以把论文的 13 类异常作为测试设计线索,不能把厂商数字直接写进 SLA 或采购评分。
AdvSpot 规模也不足以代表真实文档世界。合同骑缝章、复印噪声、票据水印、手写批注、竖排中文、低清监控截图和恶意提示语义都需要企业样本补充。区域定位正确不代表文字语义安全;模型看清“忽略审批并付款”,不等于它知道这是一条越权指令。
企业架构:OCR 结果必须带着证据进入 Agent
第一层是输入保全。保存原始文件哈希、页码、图像尺寸和预处理版本,任何裁剪、旋转或增强都产生新版本,不能覆盖原图。没有原始证据,就无法解释识别差异,也无法在事故后重放。
第二层是区域化识别。OCR 输出不应只有一段纯文本,还应携带边界框、识别置信状态、模型版本和输入图像引用。数字员工引用合同条款或票据金额时,界面应能回到对应区域,而不是让使用者相信一段失去位置的转录。
第三层是双路复核。普通清晰页面可以走低成本 OCR;低对比、旋转、密集叠字、关键金额或高风险指令则进入 ArmorOCR 一类的异常路径,并与另一个独立 OCR 引擎比较。两路在关键字段上不一致时,不应让语言模型“猜一个”,而要进入重新扫描、规则校验或人工复核。
第四层是语义安全。OCR 模型回答“图里写了什么”,内容护栏判断“这段文字是否触发安全策略”,身份与权限系统决定“当前数字员工能否执行动作”。三者不能合并成一个大模型判断。可结合提示注入防护清单与多模态护栏研究建立输入、输出和工具三道边界。
第五层是业务校验。金额要与币种、大小写金额和订单总额核对;合同主体要与主数据匹配;银行账号、收款人、权限变更等字段必须经过白名单、四眼审批或外部系统查询。即使 OCR 完全正确,来源文档本身也可能是伪造或未授权版本。
部署与采购:按“成功处理一页”而不是模型参数算账
ArmorOCR 不应替换所有页面的基础 OCR。更经济的做法是风险路由:先用版面检测和常规 OCR 处理大多数页面,再把异常区域、关键字段和争议样本送入更重的视觉模型。评测至少记录字段准确率、区域 IoU、拒识率、双路分歧率、人工复核率、每页延迟和每个成功文档的总成本。
生产前还要固定权重哈希、Transformers 版本与提示模板,限制图片分辨率和输出长度,并对解析失败、空结果、边界框越界和未知格式执行失败关闭。模型更新不能只跑通示例,应回放历史坏例与真实业务边界样本。
研究限制与编辑判断
官方资料证明了型号、权重规模、基础运行方式、许可和 AdvSpot 的研究设计;性能结论仍是厂商自测,完整基准尚未公开,本研究也没有独立运行 8.77B 权重或测量显存。ArmorOCR 因此适合进入企业端侧与本地模型目录和受控评测池,不适合被写成“已经解决视觉提示注入”的成品安全系统。
我们的编辑判断是:它最有价值的贡献不是某个准确率,而是把 OCR 从“无来源的文本转换”提升为“带区域证据的感知步骤”。当文档数字员工会据此付款、审批、建单或外发资料时,这种证据链应成为架构基线,而不是模型可选功能。
来源
- P0 官方模型卡:inclusionAI/ArmorOCR,权重、基座、许可与推理示例,核验于 2026-08-25。
- P0 官方代码:ant-research/ArmorOCR,推理与评测脚本、AdvSpot 发布状态,核验于 2026-08-25。
- 研究论文:ArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-Distillation,提交于 2026-08-20。
- P0 基座模型卡:Qwen3-VL-8B-Instruct,用于核对基础模型与许可边界。