What goes in, what comes out
IN
programy nadawców, katalogi VOD, obrazy i treści z tysięcy źródeł, w dowolnym formacie, w jakim je przesyłają.
OUT
czyste, znormalizowane i zdeduplikowane dane, skierowane do właściwego kanału lub tytułu i gotowe do przekazania do Harmonization & Enrichment, z każdą zmianą już wykrytą.
Pipeline pozyskiwania danych
Dane przychodzące przechodzą przez zdefiniowaną sekwencję kroków, w większości automatyczną, w którą redaktorzy angażują się jedynie w przypadku wyjątków:
1. Zbieranie z dowolnego źródła. Platforma nieprzerwanie monitoruje i pobiera dane, niezależnie od tego, gdzie się znajdują:
- portale i strony internetowe nadawców
- serwery FTP/SFTP
- API nadawców (REST i SOAP)
- skrzynki e-mail
- pamięć masowa w chmurze (Amazon S3, Google Cloud Storage, Azure Blob)
2. Klasyfikacja i kierowanie. Każdy przychodzący plik jest identyfikowany według typu (pełny tygodniowy program, aktualizacja przyrostowa, plik z opisami, pakiet obrazów) i kierowany do właściwego kanału. Dostępny jest podgląd czytelny dla człowieka (XML, CSV, DOC/DOCX, PDF), a import można skonfigurować dla każdego kanału jako w pełni automatyczny albo wymagający zatwierdzenia.
3. Import i mapowanie. Dedykowany importer dla każdego źródła i formatu konwertuje dane wejściowe do jednej, ujednoliconej struktury wewnętrznej, stosuje mapowanie pól właściwe dla danego nadawcy i przeprowadza wstępną kontrolę jakości: obecność wymaganych pól, spójność chronologiczną (brak nakładających się programów), poprawione kodowanie i format.
4. Analiza tekstu. Przetwarzanie języka naturalnego wydobywa informacje ukryte w opisach w formie wolnego tekstu, takie jak nazwiska gości czy numery odcinków, uzupełnia brakujące dane i przypisuje je do właściwych pól.
5. Stosowanie reguł i dopasowanie. Silnik reguł biznesowych automatycznie porządkuje systematyczne błędy źródeł (tytuły pisane małymi literami, niepożądane prefiksy, źle umieszczone dane), a następnie dopasowuje każdy wpis do właściwego rekordu w archiwum treści.
Wykrywanie tego, co naprawdę się zmieniło
Kiedy źródło przesyła aktualizację, platforma porównuje ją z aktualnym stanem i pokazuje dokładnie, co się różni, pole po polu, w widoku obok siebie. Zaufane zmiany niskiego ryzyka mogą być stosowane automatycznie; wszystko, co niestandardowe lub niejednoznaczne, jest oznaczane do akceptacji, poprawienia lub odrzucenia przez redaktora, z pełną ścieżką audytu każdej decyzji.
Kluczowa zasada utrzymuje wydajność systemów po Twojej stronie: zmiana trafia dalej tylko wtedy, gdy faktycznie wpływa na dane, które otrzymujesz, a nie przy każdej wewnętrznej edycji. Nie zalewamy Cię aktualizacjami, które u Ciebie niczego nie zmieniają.
Normalizacja ponad 2500 formatów
Źródła przesyłają dane w wielu różnych postaciach: XML, JSON, CSV, arkusze kalkulacyjne, pliki PDF, formaty specyficzne dla danego nadawcy i wiele innych, łącznie ponad 2500 formatów wejściowych. Każdy z nich jest konwertowany do jednego formatu wewnętrznego i mapowany na właściwe pola, dzięki czemu reszta platformy widzi jedną, spójną strukturę, niezależnie od pochodzenia danych. To właśnie dzięki temu Media Press może obsłużyć nowe źródło bez zakłócania niczego w dalszej części pipeline'u.
Products that live here
Zacznij teraz
Zobacz Data Ingest w akcji
Zarezerwuj demo aby zobaczyć, jak Data Ingest obsługuje Twoje źródła.