当你唯一的简历副本是扫描图像或手机拍照,而不是文本文件时,CVBuilderKit依然能够读取它,但接下来会发生什么,取决于你实际拥有的是这两者中的哪一种。扫描或拍照的PDF文件会像任何PDF一样被读取其文本层,最多读取前四页,而且这些页面也都会同时被渲染成图像,与找到的任何文本一起发送,因为没有真正文本层的页面否则会以空白导入。单独保存为PNG、JPEG或WEBP文件、而不是包在PDF里的一张页面照片,会完全跳过文本读取这一步,只作为一张图像发送。无论哪种方式,获得可用结果都始于源图像的质量,而不是导入步骤之后能修复的任何东西。
扫描PDF与拍照图像有何不同
由扫描应用或文档扫描仪生成的扫描PDF,其页面图像底下是否带有真正的文本层,取决于生成它的应用是否自行运行过文字识别。CVBuilderKit的导入并不需要那个文本层存在:它总会尝试读取任何PDF前四页的文本,也总会把这些页面同时渲染成图像,因此一份底下没有可用文本的扫描PDF,依然会以一组页面图像的形式送达,供提取步骤以视觉方式读取。单独上传的一张纯图像文件工作方式不同。因为它一开始就没有可供读取文本的页面结构,所以它纯粹作为一张图像发送,完全不会尝试任何文本读取步骤。实际的差别在于页数:一份PDF可以一次携带扫描文档的好几页,而一张独立的图像文件始终只代表它所拍摄的那一页。
上传前先拿到一张清晰可读的原图
一张平整、光线均匀、裁剪得当的页面照片,通常比匆忙拍下的照片效果更干净。把页面压平拍摄,而不是带着卷曲或折痕去拍,能避免在文本上引入一种平直扫描永远不会有的扭曲。均匀、柔和的光线而不是直接的闪光灯,能让反光远离光面纸张,因为一处直接落在文字行上的强反光,确实可能让结果图像中的那一行变得难以辨认。把照片裁剪到接近页面本身的边缘,而不是四周留出大片桌面或背景,能让实际文字在浏览器最终发送的分辨率内尽可能大、尽可能清晰,因为照片在发送前会被自动缩小,而裁剪紧凑的页面能把更多分辨率留给文字本身。坚持一张图像对应一页也值得做,而不是试图把两页并排塞进一张照片里,因为一旦两页共用同一个画面,每一页上的文字最终都会变得更小、更难读。
一次一个文件:把多页合并成一份PDF
上传功能始终只接受一次一个文件,所以单独上传的一张照片只会贡献它所显示的那一页,仅此而已。如果一份简历跨越了不止一张拍照页面,实际的做法是先把那些单独的照片合并成一份多页PDF,使用手机自带的文档扫描功能或类似的扫描应用,而不是试图一页一页地分别上传。合并后的PDF随后会把它前四页的文字和图像一起读取,在一次导入中完成,而一系列单独的照片上传每次只会替换页面上已有的那一张,而不会累积成一份多页文档。
基于图像的导入后仍需检查什么
因为对于纯图像或没有文本的扫描页面来说,底层根本没有文本可供提取,提取步骤为这类来源返回的每一行内容,都来自对图像本身的识别,而不是复制可靠的数字文本,所以之后仔细通读一遍,在这里比对基于文本的PDF更加重要,将PDF简历重建为可编辑文档对那个起点有更详细的说明。数字和日期尤其值得再单独看一眼。一张略微模糊或光线不佳的照片,把某个数字读成另一个数字,正是这个阶段最容易引入、之后快速浏览时又最容易漏看的那种小错误。
示例说明:图像导入后需要人工核对的一个字段
示例说明。一张拍照的简历页面在页首用一种略微模糊、低对比度的字体排出电话号码,旁边配的是一个小图标而不是文字标签。基于图像的导入完成后,那一页上的其他内容,职位名称、要点、页面靠下位置用更清晰、更高对比度字体排出的日期,都读取正确,但电话号码却出现了一位数字错位的情况,因为一张模糊的照片,即便认真辨认,可用的信息也比同一页面上其他地方清晰印刷的文字要少。这一个字段正是那种值得在把简历发送出去之前单独核对的细节,而不是假设整份文档的识别,都像那些最容易拍好的部分一样顺利。
开始重建
扫描或拍照的简历不必仅仅因为来源不是文本就成为死路。为每一页拍一张平整、光线充足、裁剪得当的照片,如果有多页就先合并成一份PDF,然后开始重建。如果来源本来就是基于文本的PDF,将PDF简历重建为可编辑文档介绍了那个起点相应的操作流程,如何撰写简历则说明了内容导入完成后,值得检查的整体结构。
