Attributes | Values |
---|
rdf:type
| |
rdfs:seeAlso
| |
Description
| - SpiderLing - a web spider for linguistics - is a software for obtaining large textual data from the web. The purpose of the obtained data is building text corpora. Many documents on the web only contain material not suitable for text corpora, such as site navigation, lists of links, lists of products, and other kind of text not comprised of full sentences. In fact such pages represent the vast majority of the web. Therefore, by doing unrestricted web crawls, we typically download a lot of data which gets filtered out during post-processing. This makes the process of web corpus collection inefficient. SpiderLing focuses the crawling on the text rich parts of the web and maximizes the number of words in the final corpus per downloaded megabyte. The crawler was used for building large corpora in American Spanish, Arabic, Czech, English, Estonian, French, Hungarian, Japanese, Korean, Polish, Russian, Tajik, and six Turkic languages consisting of 74 billion words altogether.
- SpiderLing - a web spider for linguistics - is a software for obtaining large textual data from the web. The purpose of the obtained data is building text corpora. Many documents on the web only contain material not suitable for text corpora, such as site navigation, lists of links, lists of products, and other kind of text not comprised of full sentences. In fact such pages represent the vast majority of the web. Therefore, by doing unrestricted web crawls, we typically download a lot of data which gets filtered out during post-processing. This makes the process of web corpus collection inefficient. SpiderLing focuses the crawling on the text rich parts of the web and maximizes the number of words in the final corpus per downloaded megabyte. The crawler was used for building large corpora in American Spanish, Arabic, Czech, English, Estonian, French, Hungarian, Japanese, Korean, Polish, Russian, Tajik, and six Turkic languages consisting of 74 billion words altogether. (en)
|
Title
| - SpiderLing
- SpiderLing (en)
|
skos:prefLabel
| - SpiderLing
- SpiderLing (en)
|
skos:notation
| - RIV/00216224:14330/12:00064706!RIV13-MSM-14330___
|
http://linked.open...avai/riv/aktivita
| |
http://linked.open...avai/riv/aktivity
| |
http://linked.open...vai/riv/dodaniDat
| |
http://linked.open...aciTvurceVysledku
| |
http://linked.open.../riv/druhVysledku
| |
http://linked.open...iv/duvernostUdaju
| |
http://linked.open...onomickeParametry
| - Úspory: Oproti dříve používanému nástroji Heritrix bylo - sníženo zatížení univerzitních strojů a sítě (zkrácen strojový čas potřebný k běhu programu a sníženo množství přenesených dat) - dosaženo vyšší výtěžnosti získaných dat Umožnění navazujících projektů: V případě nasazení méně specializovaného nástroje (běžného crawleru) by bylo nutno využít více prostředků po delší dobu, tudíž by nebylo sestaveno takové množství textových korpusů a nemohly úspěšně navázat projekty uživatelů korpusů (např. vývoj morfologického analyzátoru tádžické perštiny, výuka angličtiny, jazykové analýzy a další). Velké textové korpusy sestavené v Centru zpracování přirozeného jazyka na Fakultě informatiky Masarykovy univerzity jsou zdarma dostupné pro zaměstance a studenty Masarykovy univerzity. Některé korpusy jsou využívány také Oddělením anglistiky Filozofické fakulty Univerzity Palackého Olomouc.
|
http://linked.open...titaPredkladatele
| |
http://linked.open...dnocenehoVysledku
| |
http://linked.open...ai/riv/idVysledku
| - RIV/00216224:14330/12:00064706
|
http://linked.open...terniIdentifikace
| |
http://linked.open...riv/jazykVysledku
| |
http://linked.open.../riv/klicovaSlova
| - web crawler; web spider; text corpora (en)
|
http://linked.open.../riv/klicoveSlovo
| |
http://linked.open...ontrolniKodProRIV
| |
http://linked.open.../licencniPoplatek
| |
http://linked.open...in/vavai/riv/obor
| |
http://linked.open...ichTvurcuVysledku
| |
http://linked.open...cetTvurcuVysledku
| |
http://linked.open...vavai/riv/projekt
| |
http://linked.open...UplatneniVysledku
| |
http://linked.open...echnickeParametry
| - Software pro získávání velkého množství textových dokumentů z internetu. Implementace v jazyce Python. Licence: GNU General Public license. Odpovědná osoba pro jednání: Mgr. Pavel Rychlý, Ph.D.; email: pary@fi.muni.cz; telefon: 549496399; adresa: Pavel Rychlý, Fakulta informatiky Masarykovy univerzity, Botanická 68a, 602 00 Brno.
|
http://linked.open...iv/tvurceVysledku
| |
http://linked.open...avai/riv/vlastnik
| |
http://linked.open...itiJinymSubjektem
| |
http://localhost/t...ganizacniJednotka
| |