Khi bản sao CV duy nhất của bạn là ảnh quét hoặc ảnh chụp bằng điện thoại thay vì tệp văn bản, CVBuilderKit vẫn đọc được, nhưng điều xảy ra tiếp theo phụ thuộc vào loại nào trong hai loại đó mà bạn thực sự có. Một tệp PDF được quét hoặc chụp ảnh vẫn được đọc lớp văn bản giống như bất kỳ PDF nào khác, tối đa bốn trang đầu tiên, và mỗi trang trong số đó cũng được hiển thị dưới dạng hình ảnh cùng với bất kỳ văn bản nào tìm thấy, vì một trang không có lớp văn bản thật sự sẽ được nhập vào dưới dạng trống nếu không làm vậy. Một bức ảnh đơn lẻ của một trang, được lưu trực tiếp dưới dạng tệp PNG, JPEG hoặc WEBP thay vì được đóng gói trong PDF, sẽ bỏ qua hoàn toàn bước đọc văn bản và được gửi đi như một hình ảnh duy nhất. Dù bằng cách nào, việc có được kết quả dùng được bắt đầu từ chất lượng của ảnh nguồn, chứ không phải từ bất cứ điều gì bước nhập liệu có thể sửa sau đó.
PDF được quét khác ảnh chụp ở điểm nào
Một PDF được quét, tạo ra bởi ứng dụng quét hoặc máy quét tài liệu, có thể có hoặc không có lớp văn bản thật bên dưới hình ảnh trang, tùy vào việc ứng dụng tạo ra nó có chạy nhận dạng văn bản riêng hay không. Việc nhập của CVBuilderKit không cần lớp văn bản đó phải tồn tại: nó luôn cố gắng đọc văn bản từ tối đa bốn trang đầu tiên của bất kỳ PDF nào, và cũng luôn hiển thị chính những trang đó dưới dạng hình ảnh, vì vậy một PDF được quét không có văn bản dùng được bên dưới vẫn được chuyển thành một tập hợp hình ảnh trang mà bước trích xuất có thể đọc bằng thị giác. Một tệp ảnh riêng lẻ được tải lên một mình hoạt động khác. Vì nó không có cấu trúc trang để đọc văn bản ngay từ đầu, nó được gửi đi hoàn toàn như một hình ảnh, không có bước đọc văn bản nào được thử. Sự khác biệt thực tế là số trang: một PDF có thể mang theo nhiều trang của một tài liệu được quét cùng lúc, trong khi một tệp ảnh độc lập chỉ đại diện cho một trang mà nó là bức ảnh chụp.
Có được nguồn dễ đọc trước khi tải lên
Một bức ảnh phẳng, được chiếu sáng đều và được cắt gọn của một trang thường cho kết quả sạch hơn so với một bức ảnh chụp vội vàng. Làm phẳng trang thay vì chụp ảnh nó với nếp gấp hoặc cong tránh việc tạo ra sự méo mó trên văn bản mà một bản quét thẳng không bao giờ có. Ánh sáng đều, khuếch tán thay vì đèn flash trực tiếp giúp tránh lóa trên giấy bóng, vì một phản chiếu sáng nằm ngay trên một dòng văn bản thực sự có thể khiến dòng đó không đọc được trong hình ảnh kết quả. Cắt bức ảnh xuống gần với các cạnh của trang, thay vì bao gồm một viền rộng của bàn làm việc hoặc nền xung quanh, giữ cho văn bản thực tế lớn và chi tiết nhất có thể trong bất kỳ độ phân giải nào mà trình duyệt cuối cùng gửi đi, vì một bức ảnh được tự động thay đổi kích thước trước khi gửi và một trang được cắt gọn giữ được nhiều độ phân giải hơn để làm việc trên chính văn bản. Một trang cho mỗi hình ảnh cũng đáng để tuân theo, thay vì cố gắng nhét hai trang cạnh nhau vào một bức ảnh duy nhất, vì văn bản trên mỗi trang riêng lẻ sẽ nhỏ hơn và khó đọc hơn khi hai trang chia sẻ cùng một khung hình.
Một tệp mỗi lần: kết hợp nhiều trang vào một PDF duy nhất
Việc tải lên chỉ bao giờ nhận một tệp mỗi lần, vì vậy một bức ảnh được tải lên một mình chỉ đóng góp đúng một trang mà nó cho thấy, không hơn. Nếu một CV kéo dài hơn một trang được chụp ảnh, cách thực tế là kết hợp những bức ảnh riêng lẻ đó thành một PDF nhiều trang trước khi tải lên, dùng tính năng quét tài liệu của điện thoại hoặc một ứng dụng quét tương tự, thay vì cố gắng tải các trang lên từng cái một. Một PDF kết hợp sau đó được đọc tối đa bốn trang đầu tiên của nó cùng nhau, cả văn bản lẫn hình ảnh, trong một lần nhập duy nhất, trong khi một loạt các lần tải ảnh riêng lẻ mỗi lần chỉ thay thế bức ảnh đã có trên trang chứ không cộng dồn thành một tài liệu nhiều trang.
Điều vẫn cần kiểm tra sau khi nhập dựa trên hình ảnh
Vì không có gì về văn bản gốc để trích xuất đối với một hình ảnh thuần túy hoặc một trang được quét không có văn bản, mọi dòng mà bước trích xuất trả về cho loại nguồn đó đến từ việc đọc chính hình ảnh chứ không phải sao chép văn bản số đáng tin cậy, vì vậy việc đọc lại cẩn thận sau đó thậm chí còn quan trọng hơn ở đây so với một PDF dựa trên văn bản, điểm khởi đầu được nói rõ hơn trong xây dựng lại CV PDF thành tài liệu chỉnh sửa được. Số và ngày tháng đáng được xem lại cụ thể. Một chữ số được đọc thành một chữ số khác từ một bức ảnh hơi mờ hoặc thiếu sáng chính xác là loại lỗi nhỏ dễ xuất hiện ở bước này và dễ bị bỏ sót lần nữa khi lướt qua nhanh sau đó.
Ví dụ minh họa: một trường cần kiểm tra thủ công sau khi nhập từ ảnh
Ví dụ minh họa. Một trang CV được chụp ảnh cho thấy số điện thoại được đặt bằng phông chữ hơi mờ, độ tương phản thấp ở phần đầu, bên cạnh một biểu tượng nhỏ thay vì nhãn văn bản. Sau khi nhập dựa trên hình ảnh, mọi thứ khác trên trang đó, chức danh công việc, các gạch đầu dòng, ngày tháng đặt xa hơn xuống trang bằng phông chữ rõ ràng hơn, độ tương phản cao hơn, đọc đúng, nhưng số điện thoại lại xuất hiện với một chữ số bị đảo vị trí, vì một bức ảnh mờ cho dù đọc cẩn thận cũng có ít thông tin để làm việc hơn so với văn bản in sắc nét ở mọi nơi khác trên cùng trang đó. Trường đơn lẻ đó chính xác là loại chi tiết đáng để kiểm tra cụ thể trước khi gửi CV đi bất cứ đâu, thay vì giả định rằng việc đọc toàn bộ tài liệu diễn ra suôn sẻ như những phần dễ chụp ảnh nhất.
Bắt đầu xây dựng lại
Một CV được quét hoặc chụp ảnh không cần phải là ngõ cụt chỉ vì nguồn không phải là văn bản. Chụp một bức ảnh phẳng, đủ sáng, được cắt gọn của mỗi trang, kết hợp nhiều trang thành một PDF trước nếu bạn có, và bắt đầu xây dựng lại. Đối với nguồn đã là PDF dựa trên văn bản, xây dựng lại CV PDF thành tài liệu chỉnh sửa được bao gồm hướng dẫn tương đương cho điểm khởi đầu đó, và cách viết sơ yếu lý lịch bao gồm cấu trúc đáng kiểm tra một khi nội dung đã được nhập vào.
