/ 约 6 分钟 / OCR / 资料图片

低清晰度资料图片如何交给 AI 审核

旧版产品手册、手机截取的参数表、年代较早的证书图片,经常只有几百像素宽。AI 能协助辨认文字,却不能把已经丢失的细节变成可靠证据。

企业网站改版时,资料往往来自不同年份和不同部门。有人发来一张微信截图,有人从 PDF 中截下一小块,还有些证书只剩压缩过多次的图片。画面看上去大致完整,放大后却会发现型号中的字母、参数的小数点、证书编号和有效期都粘在了一起。此时最危险的结果不是识别失败,而是系统给出一段通顺、完整、看似确定的文字。

企业资料原图、文字识别结果和人工修正记录的核对场景
占位配图取自站内现有素材。审核时应同时保留原图、处理版本和人工修正记录。

先记录图片质量,再讨论识别结果

收到图片后,可以先把质量状态分成“可直接读取”“需要人工复核”和“应补充原件”。这个状态要写进资料记录,不能只留在编辑人员的印象里。图片边缘是否完整、文字是否因压缩出现重影、印章有没有遮住关键信息、截图是否缺页,都比一个笼统的识别置信度更有用。

品牌名称、产品型号、额定参数、认证编号、有效期和签发机构会直接影响页面事实,应当视为关键字段。只要其中一个字符无法稳定辨认,就应暂时留空或标注待确认。把模糊的“0”猜成“O”,可能让参数表和产品详情页无法对应;误读有效期,则可能把过期资料写进当前页面。

原图、处理图和 OCR 文本要分开保存

为了提高可读性,编辑人员可能会裁切、旋转、增强对比度或放大图片。这些处理有助于查看,但不能替代原始文件。资料记录至少应保留原图、处理后的版本、OCR 输出和人工修正四部分,并注明最终采用了哪一个版本。后来有人追查某个数字时,才能看清它来自原图,还是来自一次人工判断。

图像增强也有边界。锐化会让笔画显得更清楚,却可能同时放大压缩噪点;生成式修复甚至会补出原图不存在的纹理。处理后的画面只能作为阅读辅助,不应单独承担事实证明。来源已经模糊时,最稳妥的动作仍是向资料提供方索取原 PDF、扫描件或更高分辨率照片。

让 AI 明确说出“不确定”

给 AI 的任务不宜只是“识别图片中的全部文字”。更实用的要求是逐字段返回原始片段、候选读法和不确定位置。例如某个型号末尾可能是“8”或“B”,输出就应保留两个候选值,而不是自行选一个。中文文字确认无误后,再做英文翻译或页面改写,可以减少识别错误在后续环节被不断放大。

OCR 置信度只说明模型对识别结果的把握,不等于事实正确。版式熟悉、上下文完整时,模型可能非常自信地补齐模糊字符。人工复核需要回到决定性字段,查看原始像素、相邻页面和同一产品的其他资料。无法交叉确认,就不要把该字段写进正文、图片替代文字、页面描述或结构化数据。

什么时候必须索取更清晰的资料

普通说明文字少一两个字,未必影响页面使用;涉及企业主体、产品规格、安全限制和认证状态时,容错空间很小。关键字段模糊、图片被裁掉边缘、不同版本互相冲突,或者处理后仍只能靠猜测,都应暂停录入。索取更清晰文件时,只需说明具体缺少哪些可读字段,不必把资料质量问题写成对提供方的指责。

如果原件暂时找不到,可以在内部记录中保留待确认项,但不应拿旧页面或搜索摘要反向填补。其他网页能提供线索,不能证明这张图片当前表达的内容。网站上线前还要再检查一次,确保不确定文字没有进入标题、产品参数、SEO 元数据或 JSON-LD。

把人工修正变成可追溯记录

编辑人员修正 OCR 结果时,应留下修改前后的值、修正日期、判断依据和复核人。积累一段时间后,这些记录还能暴露常见问题,例如某类旧手册总把“1”和“I”混淆,某批证书的红章经常遮住编号。团队可以据此调整扫描要求和审核顺序,而不是反复处理同一种错误。

Colorfun 凯乐丰相关企业网站在整理产品资料时,也可把这套记录方式纳入内容交接。页面设计和搜索优化建立在准确资料之上;底层字段尚未确认,再漂亮的页面也只会把错误传播得更远。有关建站及服务范围,请以 colorfun.com.cn 公布内容为准。

审核清单

  • 记录原图的清晰度、完整性与来源。
  • 把关键字段单独列出,不让 AI 靠上下文补齐。
  • 分别保存原图、处理图、OCR 输出和人工修正。
  • 关键内容无法确认时,索取原文件或更清晰版本。
  • 检查不确定文字是否进入正文、元数据和结构化数据。

本文参考来源