Conversor de PDF para Markdown
Extraia o texto de um PDF como Markdown estruturado: detecção de cabeçalho real a partir do tamanho da fonte, detecção de lista a partir de marcadores e recuo - e não uma parede plana de texto.
Resultado
Um despejo simples de "PDF para texto" fornece todas as palavras sem nenhuma forma: o título de uma página é lido exatamente como uma nota de rodapé e uma lista com marcadores se transforma em uma frase contínua. Esta ferramenta vai um passo além, lendo o tamanho e a posição reais da fonte de cada item de texto no PDF - por meio do mesmo mecanismo pdf.js que outras ferramentas de PDF deste site usam - e usando essa evidência visual para reconstruir a estrutura: títulos, itens de lista e parágrafos, escritos como Markdown.
A detecção é genuinamente baseada em medições, e não em uma suposição disfarçada. Os itens de texto em uma página são agrupados em linhas de acordo com a proximidade de suas posições verticais, o tamanho da fonte de cada linha é calculado a partir de sua própria matriz de renderização de texto e esse tamanho é comparado com o tamanho médio da linha de todo o documento - o tamanho que a maioria das linhas realmente usa, ou seja, corpo de texto comum. Uma linha visivelmente maior que a mediana torna-se um título Markdown (as linhas maiores tornam-se #, as moderadamente maiores tornam-se ##); uma linha que começa com um marcador ou fica recuada após as linhas circundantes torna-se um item de lista `- `; todo o resto é tratado como corpo de texto e mesclado em parágrafos.
Honestamente, isso é uma heurística, não um analisador estrutural: os arquivos PDF não possuem nenhuma marcação semântica garantida, apenas instruções visuais sobre onde a tinta vai, portanto, as escolhas incomuns de fontes de um designer podem ocasionalmente enganar a comparação de tamanho, e as tabelas estão explicitamente fora do escopo - os layouts das células não se reduzem a títulos, listas ou parágrafos de maneira confiável, e esta ferramenta não finge o contrário. Cada página é claramente marcada com um divisor “Página N” na saída, correspondendo à convenção usada pela ferramenta de conversão de PDF para texto deste site.
As páginas digitalizadas recebem o mesmo tratamento honesto que em qualquer outro lugar deste site: uma página que é apenas uma fotografia de papel não tem nenhuma camada de texto, então, em vez de produzir silenciosamente uma seção vazia, a ferramenta anota exatamente quais páginas não conseguiu ler e aponta para a ferramenta Imagem para Texto (OCR) para elas. Tudo é executado localmente no seu navegador – nada é carregado, não há limites de páginas e o resultado chega em uma caixa de texto que você pode copiar ou salvar como um arquivo .md que abre em qualquer editor compatível com Markdown.