Lemmatizace ČEP
Karta Lemmatizace ve studijním panelu ukazuje, odkud se vzalo lemma (základní, slovníkový tvar) a slovní druh u slov Českého ekumenického překladu — a jak spolehlivý ten údaj je. Tato stránka vysvětluje, co jednotlivé stavy a signály na kartě znamenají, aby je dokázal přečíst i nelingvista.
Pro úplný technický popis pipeline slouží samostatná vývojářská reference (odkaz na konci stránky).
Proč je lemmatizace ČEP strojová
Masoretský text má v portálu morfologii ručně anotovanou databází BHSA — anotaci připravili a prověřili lidé. ČEP žádnou takovou anotaci nemá: je to novodobý překlad bez vlastní morfologické vrstvy. Aby nad ním fungovalo vyhledávání podle slov, navigace po výskytech a zobrazení morfologie, bylo nutné lemma a slovní druh ke každému slovu doplnit automaticky.
Strojová anotace je proto ze své podstaty odhad. ČEP navíc leží mimo doménu, na níž byly obecné modely češtiny trénovány (publicistika a beletrie 90. let): biblický text má archaické a knižní tvary, vysokou hustotu vlastních jmen (Šém, Nimrod, Jákob) a rigidní prorocké formule. Karta Lemmatizace existuje právě proto, aby tento odhad byl přiznaný a čitelný — ne skrytý.
Pipeline ve zkratce
Lemma se k tokenu nepřiřazuje z jediného zdroje. Několik nástrojů nejprve nezávisle navrhne kandidáta (lemma + slovní druh + rysy), kandidáti se ověří validačními signály a teprve pak proběhne výběr vítěze. Ověřování je tak součástí rozhodování, ne dodatečnou kontrolou.
| Krok | Co se děje |
|---|---|
| Kandidáti | UDPipe (značkovač ÚFAL) dodá tři varianty kandidáta — UDPipe (verš na jeden řádek), UDPipe (věty) se zachováním interpunkce a UDPipe 2 přes vzdálenou službu LINDAT (transformerový model). MorphoDiTa přidá nezávislého kandidáta opřeného o slovník MorfFlex — lokální variantu a MorphoDiTa 2 (LINDAT) s novějším modelem MorfFlex 2.1. LLM (lokální jazykový model) se volá selektivně — jen tam, kde ani jeden z předchozích zdrojů nedodal důvěryhodný návrh, typicky u krátkých víceznačných tvarů. |
| Validační signály | Tři nezávislé kontroly ověří každého kandidáta — viz níže. |
| Vážené skórování | Každý kandidát dostane skóre = základní důvěryhodnost × faktory z validačních signálů. Shodnou-li se dva či více zdrojů na témže lemmatu, vítěz dostane bonus. Vítěz se zapíše k tokenu spolu se stavem řešení. |
Validační signály
Než se vybere vítěz, prověří se kandidáti třemi nezávislými signály. Na kartě se zobrazují jako značky ✓ / ✗ a pomáhají posoudit, proč má lemma takový stav.
| Signál | Co ověřuje | Co znamená ✗ |
|---|---|---|
| Roundtrip | Z navrženého lemmatu a rysů se zkusí zpětně sestavit původní tvar slova. | Lemma a rysy spolu nejsou konzistentní. Většina neshod ovšem připadá na vlastní jména mimo slovník — ne na skutečně chybné lemma. |
| Frekvenční anomálie | Jak často se ve zbytku korpusu daný tvar mapuje právě na toto lemma. | Toto mapování je v korpusu menšinové (pod 10 %) — tvar se jinde čte převážně jako jiné lemma. Podezřelé, ne nutně chybné. |
| Audit pravidel | Sada detektorů hledá známé typy chyb (lemma ve skloňovaném tvaru, slovní druh AUX bez lemmatu být, poškozené vlastní jméno aj.). | Spustil se jeden či více detektorů. Karta ukazuje kterých — a jakou hodnotu detektor navrhuje místo stávající. |
Signály jsou diagnostické: ✗ je upozornění, ne rozsudek. Vážené skórování řadu zachycených případů vyřeší přepnutím na jiný zdroj, takže spuštěný detektor neznamená automaticky chybu ve finálním datu.
Stav řešení
Každý token dostane jeden ze šesti stavů (resolution_status).
Stavy se sdružují do tří úrovní důvěry — to je to hlavní, co má
čtenář z karty vyčíst.
Úroveň 1 — zdroje se shodly
Lemma potvrdily nejméně dva nezávislé zdroje. Nejspolehlivější skupina; zahrnuje drtivou většinu korpusu.
| Stav | Význam |
|---|---|
auto_agree | Dva či více zdrojů navrhly totéž lemma. |
auto_normalized | Zdroje se shodly po sjednocení zápisu (drobné rozdíly ve velikosti písmen, diakritice apod.). |
Úroveň 2 — vyřešeno, ale nepotvrzeno
Lemma je platné a vybrané, ale nepodložené shodou druhého zdroje. Většinou správné — jen bez křížového potvrzení.
| Stav | Význam |
|---|---|
single_source | K dispozici byl jen jediný kandidát, není s čím ho porovnat. |
auto_best | Zdroje se neshodly, ale nejlepší kandidát dosáhl dostatečného skóre a byl vybrán jako vítěz. |
Úroveň 3 — ber s rezervou
Strojové řešení tu je nejisté. Právě tyto tokeny stojí za pozornost čtenáře (a za případné nahlášení).
| Stav | Význam |
|---|---|
conflict | Kandidáti se rozcházejí a žádný nedosáhl prahu spolehlivosti. Vybralo se nejlepší dostupné lemma, ale jistota je nízká. |
insufficient | Žádný platný kandidát — krajní, velmi vzácný případ. |
Konflikty se soustřeďují u vlastních jmen a sloves — tedy přesně tam, kde obecné modely na biblickém textu nejvíc selhávají. Pipeline je proto bude do budoucna řešit cílenými heuristikami; protože je celé zobrazení datově řízené, nové přepočítání se na kartě projeví samo.
Vyřešeno opravou
Některá lemmata byla nad rámec automatické pipeline opravena — buď hromadným pravidlem, nebo ručně. U takového tokenu karta ukáže odznak opravy se zdrojem opravy a změnu původní → nové lemma; tento stav nahrazuje původní strojový stav (ten zůstává uveden zmenšeně jako „dříve: …", protože automatický rozbor se opravou nepřepisuje).
Jak to číst
- Úroveň 1 můžete brát jako spolehlivou.
- Úroveň 2 je téměř jistě v pořádku — chybí jen druhý hlas.
- Úroveň 3 ber s rezervou; je-li lemma zjevně špatné, nahlas ho přes odkaz na kartě.
Stav řešení, číselné skóre a slovní pásmo spolehlivosti jsou tři různé signály a mohou se rozcházet — např. token se shodou zdrojů může mít přesto jen střední skóre. To není chyba: každý signál vypovídá o něčem jiném.
Zdroje
- Úplný technický popis pipeline (sedm kroků, datový model, metriky, taxonomie chyb): vývojářská reference — Lematizace ČEP
- Nástroje: UDPipe a MorphoDiTa (ÚFAL MFF UK)
- Český ekumenický překlad jako text: ČEP
- Prudký, M. Cvičebnice biblické hebrejštiny. Karolinum 2014 (česká gramatická terminologie)