ПДФ у Маркдовн Цонвертер
Извуците текст из ПДФ-а као структурирани Маркдовн: откривање стварног наслова на основу величине фонта, откривање листе из знакова за набрајање и увлаке — а не један раван зид текста.
Резултат
Обичан думп „ПДФ у текст“ даје вам сваку реч без икаквог облика: наслов странице се чита баш као фуснота, а листа са набрајањем претвара се у реченицу која се понавља. Овај алат иде корак даље читајући стварну величину фонта и позицију сваке текстуалне ставке из ПДФ-а — преко истог пдф.јс механизма који користе и други ПДФ алати на овој веб локацији — и користећи те визуелне доказе да реконструише структуру: наслове, ставке листе и пасусе, написане као Маркдовн.
Детекција је заиста заснована на мерењу, а не нагађању која је обучена као једно. Текстуалне ставке на страници су груписане у редове према томе колико су блиске њихове вертикалне позиције, величина фонта сваке линије се израчунава из сопствене матрице за приказивање текста, а та величина се упоређује са средњом величином реда за цео документ — величином коју већина редова заправо користи, тј. обичан основни текст. Линија која је приметно већа од те медијане постаје Маркдовн наслов (највећи редови постају #, умерено већи постају ##); ред који почиње знаком за набрајање или се налази увучен иза околних редова постаје `- ` ставка листе; све остало се третира као основни текст и спаја у пасусе.
Ово је искрено хеуристички, а не структурални парсер: ПДФ датотеке не носе загарантовану семантичку ознаку, само визуелна упутства о томе где иде мастило, тако да необични избори фонтова дизајнера могу повремено да заварају поређење величине, а табеле су експлицитно ван опсега — распореди ћелија се не своде на наслове, листе или параграфе на било који други начин. Свака страница је јасно означена разделником „Н страна“ у излазу, што одговара конвенцији коју користи алатка за претварање ПДФ у текст ове странице.
Скениране странице добијају исти поштен третман као и другде на овој веб локацији: страница која је у ствари само фотографија папира уопште нема слој текста, тако да уместо да тихо ствара празан одељак, алатка бележи тачно које странице није могла да прочита и показује на алатку Слика у текст (ОЦР) за њих. Све се покреће локално у вашем претраживачу — ништа се не отпрема, нема ограничења страница, а резултат се налази у текстуалном оквиру који можете копирати или сачувати као .мд датотеку која се отвара у било ком уређивачу који подржава Маркдовн.