0

Conversor de PDF para Markdown

Extraia o texto de um PDF como Markdown estruturado: deteção real de cabeçalhos pelo tamanho da fonte, deteção de listas por marcadores e indentação — e não um simples bloco de texto.

🔒 Processado inteiramente em seu navegador – nada que você digita aqui é carregado.

📑

Arraste e solte o documento PDF aqui

ou Clique para procurar ficheiros PDF

A processar... 0%
A carregar PDF
A extrair texto com posições
A detetar cabeçalhos e estrutura
Concluído

Resultado

Uma simples conversão de "PDF para texto" produz todas as palavras, mas sem qualquer estrutura: um título de página é apresentado exatamente como uma nota de rodapé, e uma lista com marcadores transforma-se numa frase contínua. Esta ferramenta vai um passo além, lendo o tamanho e a posição reais da fonte de cada elemento de texto do PDF — através do mesmo motor pdf.js que as outras ferramentas de PDF deste site utilizam — e usando essa evidência visual para reconstruir a estrutura: cabeçalhos, itens de lista e parágrafos, escritos em Markdown.

A deteção é genuinamente baseada em medições, não numa suposição disfarçada. Os elementos de texto numa página são agrupados em linhas pela proximidade das suas posições verticais, o tamanho da fonte de cada linha é calculado a partir da sua própria matriz de renderização de texto, e esse tamanho é comparado com o tamanho mediano das linhas de todo o documento — o tamanho que a maioria das linhas realmente usa, ou seja, o texto corrido comum. Uma linha visivelmente maior do que essa mediana torna-se um cabeçalho Markdown (as linhas maiores tornam-se #, as moderadamente maiores tornam-se ##); uma linha que começa com um marcador ou que está indentada para além das linhas circundantes torna-se um item de lista `- `; todo o resto é tratado como texto corrido e agrupado em parágrafos.

Isto é, honestamente, uma heurística, e não um analisador estrutural: os ficheiros PDF não contêm qualquer marcação semântica garantida, apenas instruções visuais sobre onde a tinta deve ser colocada, pelo que escolhas de fontes pouco comuns por parte de um designer podem ocasionalmente enganar a comparação de tamanhos, e as tabelas estão explicitamente fora do âmbito — os layouts de células não se reduzem a cabeçalhos, listas ou parágrafos de forma fiável, e esta ferramenta não finge o contrário. Cada página é claramente assinalada com um separador "Página N" no resultado, seguindo a convenção usada pela ferramenta de PDF para texto deste site.

As páginas digitalizadas recebem o mesmo tratamento honesto que noutras partes deste site: uma página que é realmente apenas uma fotografia de papel não tem qualquer camada de texto, pelo que, em vez de produzir silenciosamente uma secção vazia, a ferramenta indica exatamente quais as páginas que não conseguiu ler e sugere a ferramenta de Imagem para Texto (OCR) para essas. Tudo é executado localmente no seu navegador — nada é enviado, não há limites de páginas, e o resultado aparece numa caixa de texto que pode copiar ou guardar como um ficheiro .md que abre em qualquer editor compatível com Markdown.