Quando a sua única cópia do currículo é uma imagem digitalizada ou uma fotografia de telemóvel em vez de um ficheiro de texto, a CVBuilderKit consegue mesmo assim lê-la, mas o que acontece a seguir depende de qual dos dois tem de facto. Um PDF digitalizado ou fotografado tem a sua camada de texto lida da mesma forma que qualquer PDF, até às primeiras quatro páginas, e cada uma dessas páginas é também convertida em imagem juntamente com qualquer texto encontrado, uma vez que uma página sem uma camada de texto real por baixo seria de outro modo importada em branco. Uma única fotografia de uma página, guardada diretamente como ficheiro PNG, JPEG ou WEBP em vez de envolvida num PDF, salta por completo o passo de leitura de texto e é enviada como uma única imagem. De qualquer forma, obter um resultado utilizável começa pela qualidade da imagem de origem, não por nada que o passo de importação possa corrigir depois.
Em que difere um PDF digitalizado de uma imagem fotografada
Um PDF digitalizado, produzido por uma aplicação de digitalização ou um digitalizador de documentos, pode ou não ter uma camada de texto real sob a imagem da página, consoante a aplicação que o criou tenha ou não executado o seu próprio reconhecimento de texto. A importação da CVBuilderKit não precisa que essa camada de texto exista: tenta sempre ler texto das primeiras quatro páginas de qualquer PDF, e converte sempre essas mesmas páginas em imagens também, pelo que um PDF digitalizado sem texto utilizável por baixo chega na mesma como um conjunto de imagens de página que o passo de extração consegue ler visualmente. Um ficheiro de fotografia isolado carregado sozinho funciona de forma diferente. Por não ter qualquer estrutura de página da qual extrair texto à partida, é enviado puramente como uma imagem, sem que seja tentado qualquer passo de leitura de texto. A diferença prática é o número de páginas: um PDF pode transportar várias páginas de um documento digitalizado de uma vez, enquanto um ficheiro de fotografia isolado representa sempre apenas a única página de que é fotografia.
Obter uma origem legível antes de enviar
Uma fotografia plana, uniformemente iluminada e recortada de uma página dá consistentemente um resultado mais limpo do que uma fotografia tirada à pressa. Aplanar uma página em vez de a fotografar com uma curvatura ou uma dobra evita introduzir uma distorção no texto que uma digitalização direita nunca tem. Uma luz uniforme e difusa em vez de um flash direto mantém o brilho afastado de papel brilhante, uma vez que um reflexo intenso colocado mesmo por cima de uma linha de texto pode tornar essa linha realmente ilegível na imagem resultante. Recortar a fotografia aproximadamente pelas margens da própria página, em vez de incluir uma margem larga de secretária ou fundo à volta, mantém o texto real o maior e mais detalhado possível dentro da resolução que o navegador acaba por enviar, uma vez que uma fotografia é automaticamente redimensionada antes de ser enviada e uma página bem recortada preserva mais dessa resolução ao serviço do próprio texto. Vale também a pena manter uma página por imagem, em vez de tentar encaixar duas páginas lado a lado numa só fotografia, uma vez que o texto de cada página individual acaba por ficar mais pequeno e mais difícil de ler assim que duas páginas partilham o mesmo enquadramento.
Um ficheiro de cada vez: combinar várias páginas num único PDF
O envio aceita sempre apenas um ficheiro de cada vez, pelo que uma fotografia enviada sozinha só contribui com a única página que mostra, nada mais. Se um currículo se estender por mais do que uma página fotografada, a via prática é combinar essas fotografias separadas num único PDF de várias páginas antes de enviar, usando a própria função de digitalização de documentos do telemóvel ou uma aplicação de digitalização semelhante, em vez de tentar enviar as páginas uma a uma. Um PDF combinado é depois lido até às suas primeiras quatro páginas em conjunto, texto e imagens ao mesmo tempo, numa única importação, enquanto uma série de envios de fotografias separadas apenas substituiria de cada vez a que já está na página em vez de se somar a um documento de várias páginas.
O que continua a ser preciso verificar após uma importação baseada em imagem
Como não havia texto subjacente para extrair no caso de uma imagem pura ou de uma página digitalizada sem texto, cada linha que o passo de extração devolve para esse tipo de origem vem da leitura da própria imagem em vez de copiar texto digital fiável, pelo que uma releitura cuidadosa depois importa ainda mais aqui do que com um PDF baseado em texto, um ponto de partida tratado com mais detalhe em reconstruir um currículo PDF num documento editável. Os números e as datas merecem um segundo olhar específico. Um dígito lido como um dígito diferente a partir de uma fotografia ligeiramente desfocada ou mal iluminada é exatamente o tipo de pequeno erro fácil de introduzir nesta fase e fácil de voltar a passar despercebido numa revisão rápida depois.
Exemplo ilustrativo: um campo que precisa de verificação manual após uma importação de imagem
Exemplo ilustrativo. Uma página de currículo fotografada mostra um número de telefone composto num tipo de letra ligeiramente desfocado e de baixo contraste no cabeçalho, ao lado de um pequeno ícone em vez de uma etiqueta de texto. Após uma importação baseada em imagem, tudo o resto nessa página, os cargos, os pontos, as datas colocadas mais abaixo na página num tipo de letra mais claro e de maior contraste, lê-se corretamente, mas o número de telefone chega com um dígito transposto, uma vez que uma fotografia desfocada dá mesmo a uma leitura cuidadosa menos com que trabalhar do que o texto impresso nítido em qualquer outro lugar dessa mesma página. Esse único campo é exatamente o tipo de detalhe que merece uma verificação específica antes de enviar o currículo para qualquer lado, em vez de presumir que a leitura de todo o documento correu tão bem como as partes mais fáceis de fotografar bem.
Comece a reconstrução
Um currículo digitalizado ou fotografado não precisa de ficar um beco sem saída só porque a origem não é texto. Tire uma fotografia plana, bem iluminada e recortada de cada página, combine mais do que uma página num único PDF primeiro se as tiver, e comece a reconstrução. Para uma origem que já é um PDF baseado em texto, reconstruir um currículo PDF num documento editável trata o percurso equivalente para esse ponto de partida, e como escrever um currículo trata a estrutura que vale a pena verificar assim que o próprio conteúdo tiver chegado.
