Skip to search
Skip to main content
Skip to first result
Search
Search Results
Creator:
Kapičiak, Jakub,
Type:
text and monografie
Subject:
Ruská literatura, rusky psaná (o ní) , Prigov, Dmitrij Aleksandrovič, , umělci ruští , umění ruské , umění konceptuální , spisovatelé ruští , literatura ruská , rozbory literárněvědné , Rusko , světové dějiny od r. 1918 do současnosti , literatura, spisovatelé , and dějiny umění, mecenát
Language:
Czech and Russian
Rights:
unknown
Creator:
Ščeblygina, Irina Vasil‘jevna,
Type:
text and studie
Subject:
Mezinárodní migrace, exil, kolonizace , emigrace ruská , vzdělanost , život kulturní , život intelektuální , intelektuálové , univerzity , Československo 1918-1938 , migrace, vystěhovalectví, kolonizace , dějiny vědy, umění, kultury a techniky, kulturní vztahy , Rusko , and světové dějiny 1918-1945
Language:
Russian
Rights:
unknown
Creator:
Černjak, Jefim Borisovič,
Type:
text and monografie
Subject:
Mezinárodní vztahy, světová politika , služby tajné , rozvědka , diplomacie tajná , zahraniční politika, mezinárodní vztahy , and světové dějiny novověku (1492-1918)
Language:
Russian
Rights:
unknown
Type:
text
Subject:
Dějiny států a území na Balkánském poloostrově , dějiny hospodářské , Bulharsko , hospodářské dějiny , and světové dějiny od r. 1945 do současnosti
Language:
Russian
Rights:
unknown
Creator:
Rosa, Rudolf
Publisher:
Charles University, Faculty of Mathematics and Physics, Institute of Formal and Applied Linguistics (UFAL)
Type:
text and corpus
Subject:
Wikipedia , text corpora , and monolingual corpus
Language:
Abkhazian , Achinese , Adyghe , Afrikaans , Akan , Tosk Albanian , Amharic , Old English (ca. 450-1100) , Arabic , Official Aramaic (700-300 BCE) , Aragonese , Egyptian Arabic , Assamese , Asturian , Atikamekw , Avaric , Aymara , South Azerbaijani , Azerbaijani , Bashkir , Bambara , Bavarian , Central Bikol , Belarusian , Bengali , Bislama , Banjar , Tibetan , Bosnian , Bishnupriya , Breton , Buginese , Bulgarian , Russia Buriat , Catalan , Min Dong Chinese , Cebuano , Czech , Chamorro , Chechen , Cherokee , Church Slavic , Chuvash , Cheyenne , Central Kurdish , Cornish , Corsican , Cree , Crimean Tatar , Kashubian , Welsh , Danish , German , Dinka , Dimli (individual language) , Dhivehi , Lower Sorbian , Dzongkha , Modern Greek (1453-) , English , Esperanto , Estonian , Basque , Ewe , Extremaduran , Faroese , Persian , Fijian , Finnish , French , Arpitan , Northern Frisian , Western Frisian , Fulah , Friulian , Gagauz , Gan Chinese , Scottish Gaelic , Irish , Galician , Gilaki , Manx , Goan Konkani , Gothic , Guarani , Gujarati , Hakka Chinese , Haitian , Hausa , Hawaiian , Serbo-Croatian , Hebrew , Herero , Fiji Hindi , Hindi , Hiri Motu , Croatian , Upper Sorbian , Hungarian , Armenian , Igbo , Ido , Inuktitut , Interlingue , Iloko , Interlingua (International Auxiliary Language Association) , Indonesian , Inupiaq , Icelandic , Italian , Jamaican Creole English , Javanese , Lojban , Japanese , Kara-Kalpak , Kabyle , Kalaallisut , Kannada , Kashmiri , Georgian , Kanuri , Kazakh , Kabardian , Kabiyè , Khmer , Kikuyu , Kinyarwanda , Kirghiz , Komi-Permyak , Komi , Kongo , Korean , Karachay-Balkar , Kölsch , Kurdish , Ladino , Lao , Latin , Latvian , Lak , Lezghian , Ligurian , Limburgan , Lingala , Lithuanian , Lombard , Northern Luri , Latgalian , Luxembourgish , Ganda , Literary Chinese , Marshallese , Maithili , Malayalam , Marathi , Moksha , Eastern Mari , Minangkabau , Macedonian , Malagasy , Maltese , Mongolian , Maori , Western Mari , Malay (macrolanguage) , Creek , Mirandese , Burmese , Erzya , Mazanderani , Min Nan Chinese , Neapolitan , Nauru , Navajo , Ndonga , Low German , Nepali (macrolanguage) , Newari , Dutch , Norwegian Nynorsk , Norwegian , Novial , Pedi , Nyanja , Occitan (post 1500) , Livvi , Oriya (macrolanguage) , Oromo , Ossetian , Pangasinan , Pampanga , Panjabi , Papiamento , Picard , Pennsylvania German , Pfaelzisch , Pitcairn-Norfolk , Pali , Piemontese , Western Panjabi , Pontic , Polish , Portuguese , Pushto , Quechua , Vlax Romani , Romansh , Romanian , Rusyn , Rundi , Macedo-Romanian , Russian , Sango , Yakut , Sanskrit , Sicilian , Scots , Samogitian , Sinhala , Slovak , Slovenian , Northern Sami , Samoan , Shona , Sindhi , Somali , Southern Sotho , Spanish , Albanian , Sardinian , Sranan Tongo , Serbian , Swati , Saterfriesisch , Sundanese , Swahili (macrolanguage) , Swedish , Silesian , Tahitian , Tamil , Tatar , Tulu , Telugu , Tama (Colombia) , Tetum , Tajik , Tagalog , Thai , Tigrinya , Tonga (Tonga Islands) , Tok Pisin , Tswana , Tsonga , Turkmen , Tumbuka , Turkish , Twi , Tuvinian , Udmurt , Uighur , Ukrainian , Urdu , Uzbek , Venetian , Venda , Veps , Vietnamese , Vlaams , Volapük , Võro , Waray (Philippines) , Walloon , Wolof , Wu Chinese , Kalmyk , Xhosa , Mingrelian , Yiddish , Yoruba , Yue Chinese , Zeeuws , Zhuang , Chinese , Zulu , and Dotyali
Description:
Wikipedia plain text data obtained from Wikipedia dumps with WikiExtractor in February 2018.
The data come from all Wikipedias for which dumps could be downloaded at [https://dumps.wikimedia.org/]. This amounts to 297 Wikipedias, usually corresponding to individual languages and identified by their ISO codes. Several special Wikipedias are included, most notably "simple" (Simple English Wikipedia) and "incubator" (tiny hatching Wikipedias in various languages).
For a list of all the Wikipedias, see [https://meta.wikimedia.org/wiki/List_of_Wikipedias].
The script which can be used to get new version of the data is included, but note that Wikipedia limits the download speed for downloading a lot of the dumps, so it takes a few days to download all of them (but one or a few can be downloaded fast).
Also, the format of the dumps changes time to time, so the script will probably eventually stop working one day.
The WikiExtractor tool [http://medialab.di.unipi.it/wiki/Wikipedia_Extractor] used to extract text from the Wikipedia dumps is not mine, I only modified it slightly to produce plaintext outputs [https://github.com/ptakopysk/wikiextractor].
Rights:
Attribution-ShareAlike 3.0 Unported (CC BY-SA 3.0) , http://creativecommons.org/licenses/by-sa/3.0/ , and PUB
Creator:
Rozanov, German Leont'jevič,
Type:
text and monografie
Subject:
Vojenství. Obrana země. Ozbrojené síly , válka druhá světová (1939-1945) , vztahy německo-ruské , operace Barbarossa (1941) , Německo , SSSR , světové dějiny 1939-1945 , and vojenské operace, války, bitvy
Language:
Russian
Rights:
unknown
Creator:
Stankov, Nikolaj Nikolajevič
Type:
text and studie
Subject:
dějiny politické , vztahy československo-německé , diplomacie , konzuláty , politické dějiny, politici , zahraniční politika, mezinárodní vztahy , světové dějiny 1918-1945 , Německo , and Československo 1918-1938
Language:
Russian
Rights:
unknown
Creator:
Speranskij, Michail Michajlovič,
Type:
text and prameny
Subject:
Dějiny SSSR a Ruska , Alexandr , Speranskij, Michail Michajlovič, , edice , dokumenty , ústava , dějiny politické , Rusko , politické dějiny, politici , and světové dějiny 1789-1918
Language:
Russian
Rights:
unknown
Creator:
Nemirovskij, Aleksandr Iosifovič,
Type:
text and studie
Subject:
Dějiny zemí starověkého světa , Italikové , doba bronzová , přehledná zpracování (tematicky) , and světové dějiny - doba bronzová
Language:
Russian
Rights:
unknown
Creator:
Zlatkovskaja, Tat'jana Davidovna,
Type:
text and studie
Subject:
Dějiny zemí starověkého světa , Burebista, , Dákové , panovníci dáčtí , and Evropa za hranicemi antického světa
Language:
Russian
Rights:
unknown