Metody strojového učení ve zpracování přirozeného jazyka

Vodička, Jan

Metody strojového učení ve zpracování přirozeného jazyka

Mark

C

Publisher

Vysoké učení technické v Brně. Fakulta informačních technologií

Abstract

Bakalářská práce se zajímá hodnocením sentimentu textu v českém jazyce za pomocí metod strojového učení, hlavně za použití naivního bayesovského klasifikátoru. Členění probíhá do dvou kategorií - pozitivní, negativní zprávy. Jako datové zdroje pro automatické vytvoření korpusu jsou použity zprávy ze sociální sítě Twitter, zbožového porovnávače Heuréka, filmové databáze ČSFD a restauračního portálu Scuk. Jsou porovnány z hlediska výkonnosti při hodnocení sentimentu. Následně je sestavena výsledná tréninková sada, která je použita při hodnocení zpráv z Twitteru v téměř reálném čase.
Bachelor's thesis deals with sentiment analysis using machine learning methods, mainly naive bayes classifier. Input text can be classified as positive or negative message. There are used several data sources for create of automatic annotated corpus - social network Twitter, price comparator Heureka, movie database ČSFD and restaurant portal Scuk. These sources are compared in terms of performance in assessing the sentiment. Consequently, the final training dataset is created and used at almost real-time Twitter sentiment analysis.

Keywords

Strojové učení, naivní bayesovský klasifikátor, hodnocení sentimentu, dolování názorů, Twitter, Machine learning, naive Bayes classifier, sentiment analysis, opinion mining, Twitter

Citation

VODIČKA, J. Metody strojového učení ve zpracování přirozeného jazyka [online]. Brno: Vysoké učení technické v Brně. Fakulta informačních technologií. 2012.

Language of document

cs

Study field

Informační technologie

Comittee

doc. Ing. František Zbořil, CSc. (předseda) prof. Ing. Martin Drahanský, Ph.D. (místopředseda) Ing. Vladimír Bartík, Ph.D. (člen) doc. Ing. Peter Chudý, Ph.D., MBA (člen) Ing. Josef Strnadel, Ph.D. (člen)

Date of acceptance

2012-06-14

Defence

Student nejprve prezentoval výsledky, kterých dosáhl v rámci své práce. Komise se pak seznámila s hodnocením vedoucího a posudkem oponenta práce. Student následně odpověděl na otázky oponenta a na další otázky přítomných. Komise se na základě posudku oponenta, hodnocení vedoucího, přednesené prezentace a odpovědí studenta na položené otázky rozhodla práci hodnotit stupněm C (dobře). Otázky u obhajoby: Proč jste ve své práci kategorizoval dokumenty jen do kategorií "pozitivní", "negativní" a nepřidal jste i kategorii "neutrální"? Datové sady jste vytvářel buď ručně, kde to není problém přidat, a nebo jste je uměle vytvářel z procentních bodů, kde by také nebyl problém tuto kategorii dodělat. V kapitole 5.1.1 o použití naivního Bayesova klasifikátoru píšete, že je možné zanedbat apriorní pravděpodobnost. Můžete komisi objasnit jak jste to myslel?

Result of defence

práce byla úspěšně obhájena

Document licence

Přístup k plnému textu prostřednictvím internetu byl licenční smlouvou omezen na dobu 10 roku/let

URI

http://hdl.handle.net/11012/55221

Collections

2012

Citace PRO

Full item page