01

先决定你正在制作什么

转录是把文书上的文字写成可以检索和阅读的文本。它不同于翻译,也不同于概括。OCR 是光学字符识别,可以为印刷材料提供初稿,却不能替你判断某个名字是否属于你的家人。先把工作分成原始图像、逐字转录、解释笔记三个部分,读者才能知道哪些内容来自文书,哪些是你的理解。

设想一封虚构的家书,写着「下月到埠,先住阿荣处」。转录应保留这句话;解释笔记可以说明「埠」可能指港口或城镇,并列出仍待确认的地点。不要直接改写成「他下月抵达悉尼」,即使你认为这个推测很合理。家人的经历值得认真阅读,文本也值得保持原来的边界。

02

给图像一个稳定的身份

开始识别前,记录材料来自谁、何时取得、共有几页,以及你是否看过原件。给每件材料一个编号,正面、背面和信封各有明确文件名。转录顶部写出编号和页码,并保存原始照片。调亮、旋转或裁切只在工作副本上进行,避免让经过处理的图像成为唯一留下的版本。

先查看整页再放大局部,尤其注意页边、印章、表格标题和上下文。一个孤立的「四」容易被误读,放回月份栏里可能就比较清楚。若照片反光或缺角,记录这一限制,争取重新拍摄。没有拍到的内容不能靠机器补成文书事实,清晰的输入比反复更换识别工具更有帮助。

03

把机器输出当作草稿

对一页印刷清楚的材料,可以先运行 OCR,再逐行对照图像。对草书、竖排、异体字或中英混排的材料,先试一小段,看看错误集中在哪里。软件输出整齐并不代表准确:列与列可能被接错,年代可能漏位,姓氏也可能被识别成常见词。把未经检查的文本明确标为「机器草稿」。

检查时优先核对名字、日期、地点、金额和亲属称谓,但仍要读完每行。虚构的账簿中,「借银十元」若被识别为「借银千元」,会把家庭生活写成完全不同的故事。把修正记录在校对笔记里,注明原机器结果及更正理由,日后换一位读者也能理解你的选择。

04

为看不清的地方订规则

给自己的项目写一份简短转录规则,例如保留原来的错字,用方括号表示编辑说明,以「[不清]」标出无法辨认的文字。不同档案平台可能有自己的规范,参与其项目时应先看官方说明。在家庭项目中,关键是规则一致,不能让你的补字看起来像文书本来就有的文字。

如果只能看出名字首字,可以写「陈[第二字不清]」,另在笔记列出两个候选读法和依据。不要因为族谱已有一个陈文,就把模糊字一律填成文。保留空缺并非失败;它指出下一步需要更好的图像、同一人的其他笔迹,或另一位熟悉该书写习惯的读者。

05

用比较而不是猜测读字

遇到陌生笔迹,先在同一页寻找已经确定的重复字,整理一个小小的对照表。某人写「林」时第二个木特别短,可能帮助你识别另一处姓氏。比较要说明来自哪一行,避免用另一份年代不同、作者不同的材料强行套用。字形相似可以支持一个读法,却仍需要句子和位置相互配合。

找一位读者独立读出关键片段,再交换结果。如果先告诉对方「这应该是祖父名字」,就容易引导答案。两人意见不同的时候,保存两个版本并列出差异;不要用投票代替核查。对于影响身份判断的一个字,可以暂时停止结论,把调查目标改成获取更清晰的复制件。

06

把转录和翻译分开保存

逐字转录完成后,再制作现代中文释读或英文翻译,标出它们是新的解释层。旧称谓和地名有时没有唯一对应词,可以保留原词并附说明。翻译不能替原文消除含糊:信上只说「兄」,译文就不应擅自确定排行、同父同母关系或个人姓名。让读者可以从译文返回相应的原句。

虚构的便条写「嫂收」,你可以译为「由嫂子收取」,另说明这个称谓的具体对象尚未确认。不要为了让叙事顺滑而加入妻子的名字。给各版本标上日期和作者,如果后来修订,留下修订记录。这样的分层也方便英语读者理解中文资料,同时看见判断尚未完成的地方。

07

交付一份可以复查的文本

分享之前,把图像、转录、译文和疑问清单一起核对,确认每段都有材料编号和页码。若只分享片段,要写明省略了什么,尤其不能剪去改变意思的前后句。可检索文本适合寻找线索,但最终使用一个事实时,仍回到图像确认它确实存在,而且没有被错列、漏字或误译改变。

完成标准不是每个字都有答案,而是每个答案能说明来处。为仍不清楚的片段列出下一步,例如补拍信封背面或请读者比较三处签名。保存一份已经检查的版本,并把新发现另行记录。当旧文字终于可以阅读,我们接近的是写信、记账、等待消息的人,而不只是家谱上的一行姓名。这种耐心让后来的家人也能参与核查。

对于表格材料,先写出栏名,再按行记录,避免把相邻家庭的姓名接在一起。记录空白栏和重复符号的处理方法:空白表示原件未填,不等于研究者已经证明没有该项信息;一个同上符号也只在明确指向前文时展开。若需要把竖排改成横排,说明阅读顺序,并保留能够定位原列的标记,方便读者重新检查。也记录表格是否跨页,确认下一页仍属于同一份材料。

资料来源

继续阅读以下机构的资料,核对适用范围及原始记录。

  1. 美国国家档案馆:转录提示www.archives.gov
  2. 美国国会图书馆:使用 OCR 协助转录blogs.loc.gov