Rukopis Voynich: Proč nejzáhadnější kniha světa stále odolává nejlepším kryptoanalytikům

Co vlastně víme o rukopisu Voynich

Rukopis Voynich je ilustrovaný kodex psaný neznámým písmem, který byl podle radiokarbonového datování vytvořen přibližně mezi lety 1404–1438. To je důležitý fakt: nejde o moderní padělek z 19. století, ale o autentický středověký artefakt. Rukopis má zhruba 240 stran, obsahuje botanické ilustrace, astronomické diagramy, textové bloky a sekce s ženskými postavami v lázních či nádržích.

Text vykazuje určitou strukturu, což je přesně důvod, proč kryptanalytici doufali v prolomení. Písmo se chová konzistentně, slova se opakují, některé znaky mají podobnou distribuci jako v přirozených jazycích. Zároveň ale chybí jasné shody s latinkou, hebrejštinou, arabštinou ani s běžnými šifrovacími systémy. Právě tato kombinace „jazykové podobnosti“ a „neprůhlednosti“ dělá z Voyniche tak těžký případ.

Proč tradiční kryptanalýza selhává

Klasická kryptoanalýza vychází z předpokladu, že máte dostatek dat, znáte typ šifry nebo alespoň jazykovou základnu. U Voyniche ale chybí obojí. Pokud jde o substituční šifru, měla by být vidět statistická podobnost s nějakým jazykem po transformaci. Pokud jde o transpozici, měly by být patrné skryté vzory v pořadí znaků. Nic z toho se zatím nepodařilo jednoznačně potvrdit.

Jedním z problémů je i to, že rukopis má velmi neobvyklou frekvenci opakování slov. Některé sekvence se objevují až podezřele často, zatímco jiné oblasti textu mají jinou distribuci. To může znamenat:

  • přirozený jazyk zapsaný neznámým systémem,
  • silně komprimovaný nebo zkrácený zápis,
  • šifru založenou na více vrstvách,
  • nebo dokonce záměrně generovaný „pseudo-text“.

V praxi se ukazuje, že čím více se badatelé snaží text rozluštit pomocí jediné univerzální metody, tím spíše narážejí na slepou uličku. U komplexních šifer je zásadní kombinovat paleografii, lingvistiku a statistickou analýzu. Samotné „hádaní významu“ bez datově podloženého rámce vede k falešným objevům.

Co odhalily moderní nástroje a AI analýza

V posledních letech se do hry dostaly metody strojového učení, n-gramové analýzy, modely podobnosti jazyků i neuronové klasifikátory. Tyto nástroje dokážou najít vzory, které člověk snadno přehlédne. Jenže u Voyniche se opakuje stejný problém: modely sice něco změří, ale neumí spolehlivě říct, co to znamená.

Například některé studie ukázaly, že text má statistiky podobné přirozenému jazyku, jiné zase tvrdily, že připomíná výstup generovaný algoritmem s omezeným slovníkem. V obou případech ale platí, že bez validního referenčního korpusu je interpretace nejistá. Pokud nemáte jistotu, zda text odpovídá latině, románskému jazyku nebo kódu, může AI najít „smysluplný“ vzor i tam, kde žádný není.

Nejpraktičtější postup dnes vypadá takto:

  • OCR a manuální transkripce do jednotného formátu.
  • Segmentace textu podle sekcí a typů ilustrací.
  • N-gramová analýza pro porovnání frekvence znaků a slov.
  • Klasterizace podobných pasáží podle stylu a délky slov.
  • Porovnání s historickými jazyky pomocí jazykových modelů.

U podobných projektů je dnes standardem pracovat s nástroji jako Python, spaCy, scikit-learn, PyTorch nebo specializovanými text-mining frameworky. Jenže i nejlepší modely jsou limitované kvalitou vstupu. U Voyniche je problematická už samotná transkripce: drobná chyba v přepisu znaků může změnit celou statistiku.

Nejčastější teorie: jazyk, šifra nebo promyšlený podvod

Teorie o původu rukopisu se dělí do tří hlavních skupin. První tvrdí, že jde o skutečný jazyk nebo jeho záznam pomocí neznámého písma. Druhá předpokládá šifru, případně vícestupňové kódování. Třetí varianta mluví o sofistikovaném podvrhu, který měl zaujmout sběratele nebo mecenáše.

Každá z těchto teorií má slabiny. Pokud by šlo o běžný jazyk, očekávali bychom větší podobnost s historickými jazyky Evropy nebo Blízkého východu. Pokud by šlo o šifru, bylo by obtížné vysvětlit rozsah textu bez chyb a zároveň vysokou konzistenci stylu. A pokud by šlo o podvod, autor by musel mít mimořádnou schopnost generovat text, který i po staletích mate odborníky, přestože nemá jasný význam.

Zajímavý je i obsah ilustrací. Botanické kresby vypadají jako směs reálných a imaginárních rostlin, astronomické diagramy naznačují zájem o kalendářní nebo kosmologická témata a „balneologická“ část může souviset s medicínou či alchymií. To napovídá, že rukopis mohl být praktickým kompendiem, nikoli jen náhodnou sbírkou symbolů. Bez rozluštění textu ale zůstává i ikonografie otevřená více výkladům.

Jak by měl postupovat současný badatel nebo datový analytik

Pokud by dnes měl někdo začít s novou analýzou Voyniche, měl by postupovat jako při seriózním datovém projektu. Nestačí mít „dobrý nápad“; je nutné vytvořit reprodukovatelný workflow. V první řadě je potřeba pracovat s kvalitní digitální kopií a oddělit jednotlivé úrovně dat: znak, slovo, řádek, stránku, sekci a ilustraci.

Praktický postup může vypadat následovně:

  • Vytvořit čistý datový set z ověřené transkripce.
  • Normalizovat varianty znaků, aby analýza nebyla zkreslená.
  • Testovat hypotézy odděleně pro různé části rukopisu.
  • Porovnávat výsledky s kontrolními vzorky z latiny, středověké němčiny, češtiny, italštiny i hebrejštiny.
  • Vyhodnocovat nejen podobnost, ale i odchylky od přirozeného jazyka.

Pro badatele je důležité i to, že rukopis není monolitický. Některé sekce se statisticky liší, což může znamenat různý účel nebo různé autory. Právě segmentace je často podceňovaná. Když smícháte dohromady botanickou a astronomickou část, snadno získáte falešný průměr, který zakryje podstatné rozdíly.

Proč Voynich fascinuje i dnes a co z něj plyne pro analytickou práci

Rukopis Voynich přežil staletí ne proto, že by byl „magický“, ale protože kombinuje několik vrstev nejasnosti najednou: neznámé písmo, nejasný jazyk, neobvyklou strukturu a vizuálně bohatý obsah. To je přesně typ problému, na kterém selhávají jednoduché nástroje a uspěje jen interdisciplinární přístup. Kryptologie, lingvistika, paleografie a moderní data science tu musí fungovat společně.

Pro dnešní analytiky je to dobrá lekce. I v digitálním marketingu, SEO nebo produktové analytice se často stává, že data „něco říkají“, ale bez kontextu mohou klamat. Voynich připomíná, že statistika bez interpretace nestačí a interpretace bez dat je jen spekulace. Největší síla je v kombinaci přesného měření, kvalitního korpusu a ochoty připustit, že některé hypotézy neobstojí.

A právě proto rukopis stále odolává i nejlepším kryptoanalytikům: není to jen šifra, ale komplexní historický problém, kde každá odpověď otevírá další otázku. Dokud nebude k dispozici nový průlom v transkripci, identifikaci jazyka nebo nalezení paralelního textu, zůstane Voynich jedním z nejlepších testů lidské trpělivosti, metodiky a analytického myšlení.