Przejdź do treści
Nasza droga do doskonałości!
Pełnotekstowy korpus polskiego Webu 1996-2001
mgr Dominik Purchała

Pełnotekstowy korpus polskiego Webu 1996-2001

2021-2025, obecnie Centrum Kompetencji Cyfrowych nauki o komunikacji społecznej i mediach

Pełnotekstowy korpus polskiego Webu z lat 1996–2001 to unikalna w skali kraju baza korpusowa archiwalnych zasobów polskiej sieci, pozyskana z archiwów fundacji Internet Archive i przygotowywana do wykorzystania w badaniach humanistycznych i społecznych. Korpus wraz z narzędziami przeszukiwania umożliwia prowadzenie nowatorskich badań nad historią polskiego internetu, przemianami języka i komunikacji, obecnością instytucji w sieci, rozwojem mediów cyfrowych oraz zmianami społecznymi i politycznymi przełomu XX i XXI wieku.
Budowa pełnotekstowego korpusu polskiego Webu z pierwszych lat obecności Internetu w Polsce (zasobów wraz z metadanymi) jest projektem unikalnym w skali kraju. Stanowi odpowiedź na potrzebę dostępu do tego typu źródeł w celach badawczych, analitycznych i dydaktycznych. Pozyskane dane są nie tylko opracowywane, ale także udostępnione w celu prowadzenia badań podejmowanych na UW, dzięki czemu badacze i badaczki mogą aktywnie włączyć się w rozwijające się na świecie badania nad historią, rozwojem i możliwościami archiwizacji Internetu.

Korpus został pozyskany i przygotowany do wykorzystania w badaniach naukowych przez Pracownię Archiwistyki Webu CKC UW.
Projekt realizowany w ramach Działania I.3.6. "Humanistyka cyfrowa", POB IV: "Przekraczanie granic humanistyki", w Programie IDUB.