0

Conversor de PDF a Markdown

Extrae el texto de un PDF como Markdown estructurado: detección real de encabezados por tamaño de fuente, detección de listas por viñetas y sangría, no una pared de texto sin forma.

🔒 Procesado íntegramente en su navegador: nada de lo que ingresa aquí se carga nunca.

📑

Arrastra y suelta el documento PDF aquí

o haz clic para buscar archivos PDF

Procesando... 0%
Cargando PDF
Extrayendo texto con posiciones
Detectando encabezados y estructura
Listo

Resultado

Un volcado simple de "PDF a texto" te da cada palabra sin ninguna forma: el título de una página se lee igual que una nota al pie, y una lista con viñetas se convierte en una frase interminable. Esta herramienta va un paso más allá al leer el tamaño y la posición reales de cada elemento de texto desde el PDF —mediante el mismo motor pdf.js que usan las otras herramientas para PDF de este sitio— y usa esa evidencia visual para reconstruir la estructura: encabezados, elementos de lista y párrafos, escritos como Markdown.

La detección se basa realmente en mediciones, no es una suposición disfrazada. Los elementos de texto de una página se agrupan en líneas según la proximidad de sus posiciones verticales; el tamaño de fuente de cada línea se calcula a partir de su propia matriz de representación de texto, y ese tamaño se compara con el tamaño de línea mediano de todo el documento —el tamaño que realmente usa la mayoría de las líneas, es decir, el cuerpo del texto normal—. Una línea notablemente más grande que esa mediana se convierte en un encabezado de Markdown (las líneas más grandes se vuelven #, las moderadamente más grandes se vuelven ##); una línea que empieza con un carácter de viñeta o que está sangrada respecto a las líneas circundantes se convierte en un elemento de lista `- `; todo lo demás se trata como texto de cuerpo y se une en párrafos.

Esto es honestamente una heurística, no un analizador estructural: los archivos PDF no contienen marcado semántico garantizado, solo instrucciones visuales sobre dónde va la tinta, así que las elecciones tipográficas inusuales de un diseñador pueden engañar ocasionalmente la comparación de tamaños, y las tablas quedan explícitamente fuera del alcance —las disposiciones de celdas no se reducen de forma fiable a encabezados, listas o párrafos, y esta herramienta no pretende lo contrario—. Cada página se marca claramente con un divisor "Página N" en la salida, siguiendo la convención que usa la herramienta de PDF a texto de este sitio.

Las páginas escaneadas reciben el mismo trato honesto que en el resto del sitio: una página que realmente es solo una fotografía de papel no tiene capa de texto alguna, así que, en lugar de producir silenciosamente una sección vacía, la herramienta indica exactamente qué páginas no pudo leer y remite a la herramienta Imagen a Texto (OCR) para esos casos. Todo se ejecuta localmente en tu navegador: no se sube nada, no hay límites de páginas y el resultado aparece en un cuadro de texto que puedes copiar o guardar como archivo .md que se abre en cualquier editor compatible con Markdown.