Strojová čitelnost

Jak ověřit strojovou čitelnost životopisu v PDF

Praktický test PDF životopisu na vlastním zařízení: vyhledání, kopírování a extrakce textu bez dohadů o ATS a nahrávání osobních údajů do náhodného online nástroje.

12 min čtení

Krátká odpověď

  • Ve finálním PDF vyhledejte přesné fráze a zkopírujte celý obsah do prostého textu.
  • Zkontrolujte úplnost, české znaky a pořadí; podle možnosti výsledek ověřte nástrojem pdftotext.
  • Vadný export opravte ve zdrojovém dokumentu. OCR použijte hlavně pro sken a výsledek ručně ověřte.
Obsah článku

Životopis může na obrazovce vypadat bezchybně, a přesto z něj textový nástroj získá prázdnou stránku, rozhází pořadí dvou sloupců nebo poškodí českou diakritiku. U obrazového skenu to popisuje technika W3C PDF7; manuál pdftotext zase upozorňuje na soubory, jejichž poškozené kódování písma brání extrakci. Prosté formátování samo o sobě nic negarantuje. Rozhodující je výsledek konkrétního exportovaného souboru. W3C: technika PDF7 · Debian Manpages: pdftotext

Krátká odpověď: ve finálním PDF vyhledejte několik přesných frází z každé stránky, zkopírujte celý obsah do prostého textu a potom, pokud můžete, udělejte nezávislou extrakci nástrojem pdftotext. Zkontrolujte úplnost, znaky a pořadí. Když je výstup prázdný nebo pomíchaný, opravte zdrojový dokument, znovu jej exportujte a test zopakujte. U skenu bez zdrojového souboru použijte OCR a jeho výsledek vždy ručně ověřte.

Tento postup můžete provést na vlastním zařízení. Nemusíte kvůli němu posílat CV s telefonem, e-mailem a pracovní historií do neznámého online „ATS testeru“.

Co v tomto článku znamená strojově čitelné

Doložený fakt: naskenovaná stránka PDF může obsahovat jen obrazová data, nikoli prohledávatelný text. OCR může k takovému dokumentu přidat text, který lze vyhledat a označit. Uvádějí to Adobe i technika W3C pro naskenovaná PDF. Adobe: rozpoznání textu ve skenovaném PDF · W3C: technika PDF7

Redakční definice Sedne: pro účely této kontroly považujeme PDF za strojově čitelné tehdy, když z něj běžný textový nástroj získá podstatný obsah úplně, se správnými znaky a v pořadí, které zachová význam. Není to certifikace, známka kvality životopisu ani předpověď výsledku výběrového řízení.

Důležitá hranice: žádný test na vlastním zařízení neprokazuje, jak se zachová každý náborový systém konkrétního zaměstnavatele. V tomto článku proto netvrdíme, že určitá šablona „projde ATS“, že dva sloupce automaticky selžou ani že prostý vzhled zaručí pohovor. Ověřujeme užší a skutečně kontrolovatelnou otázku: co lze vyčíst z vašeho souboru jako text.

Tři vrstvy, které potřebujete prověřit

Pouhé zjištění, že lze označit jedno slovo, nestačí. Praktická kontrola má tři vrstvy:

  1. Přítomnost textu: je text skutečně dostupný na všech stránkách, nebo je část CV jen obrázek?
  2. Úplnost a znaky: nechybí jméno, kontakt, názvy pozic, zaměstnavatelé, data ani důležité odrážky? Zůstala správně česká diakritika?
  3. Pořadí: navazují nadpisy, období a popisy zkušeností tak, aby dávaly smysl i bez grafického rozložení?

Pořadí je samostatný problém. Technika W3C PDF3 pro tagovaná PDF a uživatele odečítačů upozorňuje, že vizuálně jasný vícesloupcový dokument může být při nesprávné struktuře čten napříč sloupci. Zároveň neříká, že každý dokument se sloupci je chybný. Doporučuje kontrolovat logické pořadí a složitější rozvržení opravovat ve zdrojovém nástroji nebo v PDF. Tato technika ale nepopisuje chování každého textového parseru, nástroje pdftotext ani ATS. W3C: technika PDF3 pro pořadí čtení

Tento domácí test také není certifikací přístupnosti. Tagované PDF může nést zamýšlené pořadí a význam struktur, jako jsou nadpisy, seznamy a tabulky. Ověření shody s PDF/UA ale zahrnuje specializované automatické i ruční kontroly. Prosté hledání, kopírování nebo spuštění pdftotext tak odhalí užitečné příznaky, ale samo nepotvrdí shodu s PDF/UA. PDF Association: Questions and Answers about Tagged PDF

Desetiminutový test finálního PDF

Testujte přesně ten soubor, který chcete přiložit k žádosti. Ne pracovní dokument před exportem. Vytvořte si jeho kopii a výsledky porovnávejte s vizuálním originálem.

1. Vyhledejte přesné fráze na každé stránce

Otevřete PDF v běžné čtečce a použijte hledání. Nehledejte jen časté slovo jako „práce“. Vyberte několik řetězců, u nichž snadno poznáte správný výsledek:

  • část svého příjmení;
  • doménu v e-mailové adrese;
  • název jedné firmy nebo školy;
  • méně obvyklý název nástroje či kvalifikace;
  • konkrétní rok z každé stránky;
  • jedno slovo s diakritikou, například „řízení“ nebo „zákazníků“, pokud je v CV skutečně máte.

Hledání zopakujte na všech stránkách. Nalezení jména na první stránce neříká nic o druhé stránce, která mohla být do PDF vložena jako obrázek.

Výsledek berte jako první signál, ne jako konečný verdikt. Některé aplikace umějí rozpoznat text přímo v obrázku. Apple například popisuje funkci Live Text v Náhledu, která dovoluje kopírovat text z fotografie. Samotné kopírování v jedné chytré aplikaci proto nemusí dokazovat, že PDF obsahuje použitelnou textovou vrstvu. Apple: Live Text v Náhledu

2. Vložte celé CV do prostého textu

Označte celý obsah PDF, zkopírujte jej a vložte do editoru prostého textu. Na Windows může posloužit Poznámkový blok, na macOS TextEdit přepnutý na prostý text. Nyní ignorujte písmo, velikosti, barvy a odrážkové symboly. Sledujte význam.

Projděte výstup od začátku do konce a označte si:

  • chybějící celé stránky nebo sekce;
  • slova rozdělená na jednotlivá písmena;
  • záměny znaků, poškozenou diakritiku nebo znak ;
  • datum oddělené od příslušné pozice;
  • text z pravého sloupce vložený doprostřed věty v levém sloupci;
  • nadpis sekce až za jejím obsahem;
  • několikrát zopakované záhlaví nebo zápatí;
  • kontakt zobrazený jen ikonou bez textové adresy či čísla.

Ztracená barva nebo jiný tvar odrážky nejsou samy o sobě problémem strojové čitelnosti. Chybějící firma, přehozená období nebo nesrozumitelně spojené věty problém jsou. Toto rozlišení je redakční úsudek Sedne: posuzujeme, zda po odstranění grafiky zůstává význam, nikoli zda prostý text vypadá hezky.

3. Udělejte nezávislou extrakci pomocí pdftotext

Pokud máte v počítači nástroj pdftotext z balíku Poppler, otevřete Terminál nebo příkazový řádek ve složce s CV a spusťte:

pdftotext "Jan-Novak-CV.pdf" "Jan-Novak-CV.txt"

Potom otevřete vzniklý soubor Jan-Novak-CV.txt. Oficiální manuál popisuje pdftotext jako převodník PDF do prostého textu. Bez přepínače se snaží odstranit fyzické rozložení a vypsat text v pořadí čtení. Přepínač -layout se naopak snaží zachovat původní rozmístění. Debian Manpages: pdftotext

Pro druhý pohled můžete porovnat běžný výstup s tímto:

pdftotext -layout "Jan-Novak-CV.pdf" "Jan-Novak-CV-layout.txt"

Nejde o dva body jednoho skóre. Běžný výstup pomáhá odhalit pořadí, které nástroj odhadl pro souvislé čtení. Varianta -layout ukáže, co se změní při snaze zachovat fyzické rozložení. Pokud je srozumitelná pouze druhá verze, projděte problematické sloupce nebo textová pole ve zdrojovém dokumentu.

Manuál upozorňuje, že některé soubory mají kódování písem poškozené tak, že text bez OCR získat nelze. Pokud ale příkaz skončí chybou nebo textový soubor vůbec nevznikne, nejdřív vyřešte hlášený problém se vstupem, výstupem či oprávněním. Teprve úspěšně vytvořený, ale prázdný nebo poškozený text posuzujte jako závadu extrakce. Ani jeden výsledek není důvod domýšlet si obecné pravidlo o ATS. Debian Manpages: omezení a návratové kódy pdftotext

Nemáte-li pdftotext nainstalovaný, stále můžete použít první dva kroky. Jen závěr formulujte opatrněji: soubor prošel kontrolou v jedné čtečce, nikoli nezávislou textovou extrakcí.

Jak výsledek vyhodnotit bez falešného skóre

Následující semafor je redakční pomůcka Sedne, nikoli oborová norma:

  • Jasné: podstatný text ze všech stran je úplný, znaky jsou správné a pořadí dává smysl. Ještě zkontrolujte vizuální PDF a můžete pracovat na obsahu CV.
  • K revizi: text je přítomný, ale část se řadí nešikovně, opakuje se zápatí nebo se ztratily popisky ikon. Opravte jen místa, která mění význam nebo znesnadňují přiřazení informace. Potom znovu exportujte.
  • Vysoké riziko extrakce: výstup je prázdný, chybí stránka či sekce, znaky jsou nečitelné nebo se zkušenosti a data promíchaly. Soubor neposílejte jako hotový. Vraťte se ke zdroji, případně použijte OCR, a zopakujte všechny testy.

Tato označení popisují riziko technického získávání textu ze souboru. Neříkají, zda jste vhodným kandidátem nebo kandidátkou, ani zda vás někdo pozve na pohovor.

Co opravit podle typu závady

PDF je celé nebo zčásti obrázek

Máte-li původní dokument, otevřete ho v programu, ve kterém vznikl, a znovu ho přímo exportujte do PDF. W3C u naskenovaného dokumentu doporučuje vytvářet skutečný text v autorském nástroji a převést jej do PDF. OCR uvádí jako řešení tehdy, když zdrojový soubor není k dispozici. W3C: technika PDF7

Vyhněte se postupu, při kterém dokument vytisknete, naskenujete a sken teprve uložíte jako PDF. Vizuálně může zůstat podobný, ale bez OCR jde o obraz textu.

Sloupce se promíchaly

Nejdřív zjistěte, která konkrétní část se řadí špatně. Může jít o boční panel, samostatná textová pole nebo tabulku použitou pouze kvůli vzhledu. Technika W3C PDF3 uvádí pro tagovaná PDF a čtení odečítačem, že složitější rozvržení se nemusí do správného pořadí převést automaticky, a doporučuje strukturu řešit už v autorském nástroji. Nejde o popis chování všech parserů ani ATS. W3C: technika PDF3

Nejrychlejší opatrná oprava bývá přesunout rozhodující údaje do jednoho hlavního toku. Není to tvrzení, že všechny dva sloupce jsou špatné. Pokud váš dvousloupcový export projde úplnou extrakcí ve správném pořadí, tento test nedává důvod ho jen kvůli mýtu zahazovat.

Diakritika nebo znaky se poškodily

Vraťte se ke zdrojovému dokumentu a zkuste nový export. Zkontrolujte zejména jméno, e-mail, názvy firem, technologií a české věty. Nepřepisujte bez rozmyslu celé CV bez diakritiky. Cílem je opravit vadný export, ne ochudit text.

Když různé čtečky zobrazují PDF správně, ale pdftotext vrací nesrozumitelné znaky, může být problém v mapování písma. Manuál pdftotext výslovně popisuje případy, kdy poškozené kódování písma znemožní extrakci bez OCR. Debian Manpages: omezení pdftotext

Důležitý údaj je jen v ikoně nebo grafice

Ikonu telefonu, obálky nebo mapového bodu můžete ponechat jako dekoraci, ale vedle ní napište vlastní telefonní číslo, e-mail nebo textový název místa. Stejné pravidlo použijte na dovednostní grafy: pokud na informaci záleží, napište ji slovy. Jde o redakční doporučení Sedne, ne o tvrzení, že konkrétní systém každou ikonu ignoruje.

Když potřebujete OCR

OCR vytváří strojový text z obrazu, ale jeho použitím kontrola nekončí. Adobe po rozpoznání doporučuje ověřit, že je výsledek přesný a úplný. W3C mezi vhodné kontroly řadí uložení dokumentu jako text a prověření úplnosti i správného pořadí. Adobe: kontrola výsledku OCR · W3C: test techniky PDF7

V desktopovém Acrobatu můžete ve skenovaném souboru použít Scan & OCR, zvolit stránky a jazyk a vytvořit prohledávatelnou textovou vrstvu. Adobe: postup rozpoznání textu

Technicky zdatnější uživatel může zpracovat kopii obrazového skenu pomocí OCRmyPDF na vlastním zařízení. Dokumentace uvádí, že nástroj přidává ke skenovaným PDF prohledávatelnou OCR vrstvu. Pro standardní výstup PDF se používá volba --output-type pdf; jiný jazyk se zadává volbou -l a příslušným jazykovým balíčkem. Dokumentace také varuje, že nesprávně zvolený jazyk může kvalitu OCR zhoršit. OCRmyPDF: dokumentace · OCRmyPDF: základní příklady a volba jazyka

Pro český text používá Tesseract kód ces, pokud máte česká jazyková data nainstalovaná. Příklad pro kopii českého CV může vypadat takto: Tesseract: seznam jazykových dat

ocrmypdf -l ces --output-type pdf "CV-sken.pdf" "CV-sken-ocr.pdf"

Tento jednoduchý příkaz použijte jen pro obrazový sken bez existujícího textu. OCRmyPDF ve výchozím režimu skončí chybou, pokud na stránce text najde. U smíšeného souboru, který kombinuje digitální text a skenované stránky, dokumentace doporučuje zvolit režim vědomě: --mode skip ponechá stránky s textem beze změny, zatímco --mode redo může obnovit starou OCR vrstvu. Režim force rasterizuje všechny stránky, proto jej nepoužívejte bez konkrétního důvodu. OCRmyPDF: processing modes · OCRmyPDF: common error messages

U česko-anglického dokumentu lze použít více nainstalovaných jazyků, pokud jsou příslušné jazykové balíčky dostupné, například -l ces+eng. OCRmyPDF: Cookbook Po OCR znovu proveďte hledání, vložení do prostého textu i pdftotext. Ponechte si nezměněný originál, dokud výsledek nezkontrolujete.

Modelový příklad: hezké PDF s pomíchaným pořadím

Následující situace je smyšlená. Nejde o skutečného kandidáta, zaměstnavatele ani test konkrétního náborového systému.

Eva má v levém úzkém sloupci kontakty a dovednosti. Vpravo jsou zkušenosti. V PDF vše vypadá správně. Po extrakci však začátek textu vypadá takto:

Eva Nováková
Projektová koordinátorka
Telefon
2023 až současnost
Excel
Koordinátorka, Firma A
Praha
Připravovala podklady...

Všechna slova jsou přítomná, ale dovednost „Excel“ a místo „Praha“ se vložily mezi období, pozici a popis práce. Eva proto nemusí zahodit celý design. Nejdřív může přesunout kontakty do horní textové části a dovednosti za zkušenosti, znovu exportovat a porovnat nový výstup. Kdyby původní dva sloupce vyšly ve správném pořadí, samotná existence sloupců by v tomto redakčním testu nebyla závadou.

Kontrolní seznam před odesláním

  • Testuji finální přílohu, ne starší verzi nebo zdrojový dokument.
  • Na každé stránce lze vyhledat několik přesných frází.
  • Po vložení do prostého textu nechybí jméno, kontakt, pozice, firmy, školy, data ani důležité odrážky.
  • Česká diakritika, čísla a názvy nástrojů zůstaly správné.
  • Nadpisy, období a popisy jsou ve srozumitelném pořadí.
  • Důležitá informace není vyjádřena pouze ikonou, fotografií nebo grafem.
  • Pokud jsem použil/a OCR, porovnal/a jsem výstup s obrazem každé stránky.
  • Pokud jsem soubor opravil/a, zopakoval/a jsem test na novém exportu.
  • Výsledek si nevykládám jako záruku chování každého ATS ani jako hodnocení své vhodnosti pro práci.

Jak do této kontroly zapadá Sedne

Sedne přijímá životopis v PDF a jeho samostatná kontrola zahrnuje výsledek strojové čitelnosti. Podle aktuální produktové specifikace se tento výsledek soustředí na riziko technického zpracování textu, například na dostupnost textu, obrazové stránky, poškozenou extrakci, problematické znaky a pořadí. Není to skóre zaměstnatelnosti a Sedne nerozhoduje o přijetí.

Zkontrolovat samotné CV

Časté otázky

Když mohu text označit, je PDF v pořádku?

Je to dobrý první signál, ale ne úplný důkaz. Ověřte všechny stránky, zkopírujte celý obsah a zkontrolujte pořadí. Některé aplikace navíc umějí rozpoznávat text v obrázcích, takže je užitečná nezávislá extrakce.

Musí být životopis jednosloupcový?

Tento článek takové univerzální pravidlo nestanovuje. Sloupce jsou problém tehdy, když konkrétní export promíchá význam. Rozhodněte podle extrahovaného textu, ne podle obecné poučky bez zdroje.

Je online ATS tester přesnější než pdftotext?

Bez znalosti použitého parseru, zacházení s daty a systému zaměstnavatele to nelze obecně potvrdit. pdftotext není simulace každého ATS. Je to transparentní kontrola na vlastním zařízení, zda běžný nástroj dokáže z PDF získat text a v jakém pořadí.

Mám OCR použít i na PDF vytvořené přímo z editoru?

Ne automaticky. Nejdřív otestujte současný soubor a zkuste nový export ze zdroje. OCR je vhodné hlavně pro obrazový dokument nebo jako oprava tehdy, když zdroj nemáte. Výsledek OCR musíte zkontrolovat.

Stačí poslat také DOCX?

Řiďte se formátem, který požaduje konkrétní nabídka nebo formulář. Tento postup řeší kvalitu PDF, nikoli pravidla příloh u konkrétního zaměstnavatele.

Zdroje