ukr-twi-corpus

Twitter corpus

A collection of Ukrainian Twitter texts for linguistic analysis and research

A corpus of Ukrainian Twitter texts + instructions for downloading and filtering texts.

GitHub

15 stars
5 watching
3 forks
Language: Jupyter Notebook
last commit: about 7 years ago
Linked from 1 awesome list

corpuscorpus-generatorcorpus-linguisticsnlppythonpython-scriptpython3scraperukrainianukrainian-language

Backlinks from these awesome lists:

Related projects:

RepositoryDescriptionStars
ukrainian-to-english-corpora/folktale_corpusA collection of Ukrainian folktales translated into English for linguistic and literary research purposes.0
kateryna-bobrovnyk/obscene-ukrA collection of Ukrainian obscene words and phrases.17
brown-uk/corpusCreating a balanced corpus of modern Ukrainian language with 1 million words, based on the Brown Corpus model.110
amakukha/stemmers_ukrainianA novel stemmer for the Ukrainian language trained with AI28
vadno/korkor_pilotA large annotated corpus of Hungarian text with various linguistic annotations, split into development and test datasets for natural language processing tasks.2
universaldependencies/ud_ukrainian-iuA dataset of annotated text in Ukrainian with standardized formatting and annotation guidelines.27
proger/uk4bDevelops pretraining and finetuning techniques for language models using metadata-conditioned text generation18
khrystyna-skopyk/ukr_spell_checkSpelling correction system for the Ukrainian language using noisy channel model3
ysenarath/tweetkitA Python client for accessing the Twitter API14
simonlindgren/2wttrCollects and processes tweets from the Twitter API using Academic access20
helsinki-nlp/ukrainianltA collection of Ukrainian language tools and resources for machine translation, natural language processing, and text translation.30
lang-uk/ukrainian-abbreviations-dictionaryA dictionary of Ukrainian abbreviations with definitions and comments3
twitivity/twitter-stream.pyAn API client for accessing Twitter's v2 API endpoints to retrieve real-time tweets and other data38
nytud/hucolaA collection of 9,076 annotated sentences in Hungarian to evaluate linguistic acceptability and grammaticality1
robinhad/krukA collection of Ukrainian language models and datasets for natural language processing tasks.86