Czech Derivational Analyser
The result's identifiers
Result code in IS VaVaI
<a href="https://www.isvavai.cz/riv?ss=detail&h=RIV%2F00216224%3A14330%2F11%3A00056895" target="_blank" >RIV/00216224:14330/11:00056895 - isvavai.cz</a>
Result on the web
—
DOI - Digital Object Identifier
—
Alternative languages
Result language
čeština
Original language name
Derivační analyzátor češtiny
Original language description
Standardní morfologické analyzátory nabízejí ke vstupnímu slovu jeho základní tvar, ale neposkytují (nebo jen omezeně) informace o příbuzných slovech typu otec-otcův, Praha-pražský, řezat-řezání ap. Taková informace může být velmi užitečná při indexaci textu pro vyhledávání nebo při syntaktické analýze přirozeného jazyka. Derivační analyzátor češtiny je rychlý analyzátor poskytující informace o derivačních vztazích mezi slovy, který je dostupný jak ve formě knihovny funkcí, tak i řádkového programu. Analyzátor je založený na konečných automatech a částečně využívá algoritmy Jana Daciuka pro tvorbu minimálních konečných automatů, z čehož plyne jak rychlost analýzy, tak jednoduchost, a tedy udržovatelnost a snadná rozšiřitelnost kódu. Analyzátor má v současné době data pouze pro češtinu, ale řešení je obecné a použitelné i pro jiné jazyky.
Czech name
Derivační analyzátor češtiny
Czech description
Standardní morfologické analyzátory nabízejí ke vstupnímu slovu jeho základní tvar, ale neposkytují (nebo jen omezeně) informace o příbuzných slovech typu otec-otcův, Praha-pražský, řezat-řezání ap. Taková informace může být velmi užitečná při indexaci textu pro vyhledávání nebo při syntaktické analýze přirozeného jazyka. Derivační analyzátor češtiny je rychlý analyzátor poskytující informace o derivačních vztazích mezi slovy, který je dostupný jak ve formě knihovny funkcí, tak i řádkového programu. Analyzátor je založený na konečných automatech a částečně využívá algoritmy Jana Daciuka pro tvorbu minimálních konečných automatů, z čehož plyne jak rychlost analýzy, tak jednoduchost, a tedy udržovatelnost a snadná rozšiřitelnost kódu. Analyzátor má v současné době data pouze pro češtinu, ale řešení je obecné a použitelné i pro jiné jazyky.
Classification
Type
R - Software
CEP classification
AI - Linguistics
OECD FORD branch
—
Result continuities
Project
<a href="/en/project/LC536" target="_blank" >LC536: Integrated center for natural language processing</a><br>
Continuities
P - Projekt vyzkumu a vyvoje financovany z verejnych zdroju (s odkazem do CEP)
Others
Publication year
2011
Confidentiality
S - Úplné a pravdivé údaje o projektu nepodléhají ochraně podle zvláštních právních předpisů
Data specific for result type
Internal product ID
derivanče
Technical parameters
Odpovědná osoba pro jednání: Pavel Šmerk, Fakulta informatiky, Masarykova univerzita, Botanická 68a, Brno 60200, e-mail: smerk@mail.muni.cz, tel.: 549494347
Economical parameters
Informace poskytovaná analyzátorem umožňuje lepší indexaci textových dat a jejich následné vyhledávání. Software byl předán na testování firmě Seznam.cz a letos by měla být podepsána smlouva v hodnotě 50000-100000 Kč. Předpokládá se též využití ve vyhledávání a plagiátové kontrole vývojovým týmem Informačního systému Masarykovy univerzity (IS provozován na osmi českých VŠ/VOŠ, dále jde o celonárodní projekty theses.cz, repozitar.cz a odevzdej.cz).
Owner IČO
00216224
Owner name
Masarykova univerzita