Huang Codes

Vision · OCR · Export Workflow

OCR 之后才是难点:Pinyin Scholar 与票据裁切的可编辑工作流

OCR 识别后的校对与导出流程

做 OCR 功能时,最容易把成功标准定成“识别出了文字”。真实使用却不会停在这里。用户接下来要检查、修改、重新处理、复制或导出,识别结果只有进入下一步工作流才有价值。

Pinyin Scholar:允许原文被修正

中文 OCR 里,一个错字可能让整句拼音偏离。Pinyin Scholar 因此加入多音字确认、待确认数量和更清楚的 OCR 校对流程。历史记录也不再是只读快照:可以修改原文,再在同一条记录中重新生成标音。

“原地更新”需要防止误覆盖。编辑状态必须带着明确的记录 ID,所有新建入口都要清除这个状态,保存前再次确认目标存在。否则一次看似普通的重新标音,可能改错历史文章。

导出也继续向使用场景靠近:标题、作者能进入文档,朗读速度可以持久化,PDF 和图片提供可选深色样式,但默认仍保持适合打印的浅色。

ReceiptCropper:把结果送到下一站

票据裁切先解决了边缘检测与复杂背景误判,现在重点转向结果动作。长票据查看时,分享和保存固定在底部;处理完成后页面自动定位到结果,减少“结果到底在哪”的停顿。

1.0.6 增加 PDF 分享,并让金额、商户和日期可以一键复制。很多报销和记账流程不需要一张更漂亮的图片,而需要一份 PDF 或三段可以直接粘贴的数据。

让自动化保留撤回权

两个 App 的共同原则是:OCR 提供第一稿,用户拥有最后决定。系统要尽量自动,但也要清楚显示不确定性、保留原图、允许重做,并让结果顺畅离开当前 App。

识别率当然重要,不过一个真正好用的 OCR 工具,常常赢在识别之后的几十秒。