0

Convertidor de PDF a rebajas

Extraiga el texto de un PDF como Markdown estructurado: detección de encabezado real a partir del tamaño de fuente, detección de listas a partir de viñetas y sangría, no una pared plana de texto.

📑

Arrastre y suelte el documento PDF aquí

o haga clic para buscar archivos PDF

Buy Me a Coffee at ko-fi.com
Procesando... 0%
Cargando PDF
Extrayendo texto con posiciones
Detección de encabezados y estructura.
hecho

Resultado

Un simple volcado de "PDF a texto" le brinda cada palabra sin ninguna forma: el título de una página se lee exactamente como una nota al pie y una lista con viñetas se convierte en una oración continua. Esta herramienta va un paso más allá al leer el tamaño de fuente real y la posición de cada elemento de texto del PDF (a través del mismo motor pdf.js que usan otras herramientas de PDF de este sitio) y usar esa evidencia visual para reconstruir la estructura: encabezados, elementos de lista y párrafos, escritos como Markdown.

La detección se basa realmente en mediciones, no en una suposición disfrazada de tal. Los elementos de texto de una página se agrupan en líneas según la proximidad de sus posiciones verticales, el tamaño de fuente de cada línea se calcula a partir de su propia matriz de representación de texto y ese tamaño se compara con el tamaño de línea medio de todo el documento: el tamaño que realmente utilizan la mayoría de las líneas, es decir, el texto del cuerpo normal. Una línea notablemente más grande que esa mediana se convierte en un encabezado de Markdown (las líneas más grandes se convierten en #, las moderadamente más grandes se convierten en ##); una línea que comienza con un carácter de viñeta o se encuentra con sangría más allá de las líneas circundantes se convierte en un elemento de lista `- `; todo lo demás se trata como texto del cuerpo y se fusiona en párrafos.

Honestamente, esto es un analizador heurístico, no estructural: los archivos PDF no tienen marcado semántico garantizado, solo instrucciones visuales sobre dónde va la tinta, por lo que las elecciones de fuentes inusuales de un diseñador pueden ocasionalmente engañar la comparación de tamaños, y las tablas están explícitamente fuera de alcance: los diseños de celda no se reducen a encabezados, listas o párrafos de ninguna manera confiable, y esta herramienta no pretende lo contrario. Cada página está claramente marcada con un divisor "Página N" en el resultado, lo que coincide con la convención utilizada por la herramienta de conversión de PDF a texto de este sitio.

Las páginas escaneadas reciben el mismo tratamiento honesto que en el resto de este sitio: una página que en realidad es solo una fotografía de papel no tiene ninguna capa de texto, por lo que en lugar de producir silenciosamente una sección vacía, la herramienta anota exactamente qué páginas no pudo leer y señala la herramienta Imagen a Texto (OCR) para ellas. Todo se ejecuta localmente en su navegador: no se carga nada, no hay límites de páginas y el resultado aparece en un cuadro de texto que puede copiar o guardar como un archivo .md que se abre en cualquier editor compatible con Markdown.