/ 阅读约 6 分钟 / OCR 修正 / 人工复核
OCR 修正与人工猜测的边界在哪里
印章遮字、截图模糊和低清扫描都会让 OCR 读错。人工看清原文后改正,是有依据的修正;仅因某个值“应该如此”而补全,则已经越过边界成为猜测。

修正必须指向可见来源
人工更正应附上页码、字段、图像区域、清晰替代文件或其他正式来源。审核人能够让下一位同事看到同一依据,修正才具有可复核性。
如果原图确实看不清,企业简介、历史记录或供应商叙述只能作为查找线索,不能悄悄替换缺失字符。字段应标记为未确认,并说明需要更清楚的文件。
上下文有时能发现 OCR 结果不合理,却不一定能给出唯一正确答案。确认“模型读错了”和确认“正确值是什么”是两个步骤,不应合并。
保留原值、修正值和来源状态
记录至少包含模型原值、人工修正值、修正人、时间和来源状态。原值保留自动识别发生了什么,修正值说明当前采用什么,来源状态则解释为何能够采用。
来源状态可以区分原图清晰可见、替代文件确认、供应商陈述和仍未解决。若只有最终干净字段,后续系统很容易把一次猜测继续写入摘要、表格和网站内容。
修改记录不要覆盖原始提取。模型或 OCR 版本变化后,可以用相同样本回看错误类型,也能判断人工修正是否反复集中在某些版式和字段。
关键字段不能靠合理推测补齐
法定名称、登记号码、收款人、证书持有人、日期、产品型号和地址会影响身份、付款或合规决定。只要源文件不能支持,就应请求清晰件或寻找第二个有效来源。
低后果的描述性字段可以在不影响决定时带备注使用,但仍要区分原文与编辑性修正。业务影响决定审核强度,不会让没有来源的值自动变成事实。
结案可写“登记号码由审核人根据清晰原图修正”,或“末两位无法辨认,字段保持未确认并等待替代文件”。这比用置信分数掩盖缺口更便于执行。
网站资料录入也要保留字段边界
企业建站经常从扫描目录、证书和规格书录入参数。模糊数字、型号或资质范围若被人工猜测补齐,可能继续进入产品页、SEO 元数据和多语言版本。
Colorfun 凯乐丰相关企业建站、SEO/GEO 和 AI 内容工作,可在资料录入时保留原文件、提取值、人工修正和审核状态。关键字段未确认前不作为公开事实发布。
colorfun.com.cn 公布的主营业务与服务信息,可用于了解企业建站、SEO/GEO 和 AI 内容服务范围。具体产品、资质和交易字段,应由企业责任人员依据清晰有效的原始材料确认。
核对清单
- 让每次人工修正指向原件页码或替代来源。
- 分别保存模型原值、人工值和来源状态。
- 无法确定唯一答案时保留未确认,不补猜测值。
- 对身份、付款、证书、日期和型号执行更严格规则。
- 网站发布前检查修正字段是否已有可复核依据。
本文参考来源
- 美国国家标准与技术研究院:AI 风险管理框架用于理解 AI 风险识别、治理和记录背景,具体 OCR 复核规则应按业务影响制定。
- OECD.AI:人工智能问责资料用于理解责任、透明度与监督的一般背景,不替代企业内部审核和专业判断。