Obsahové dáta
Zahŕňajú samotný text dopytu, nahrané dokumenty, úryvky zdrojového kódu a kontextové informácie o projekte, ktoré používateľ vedome poskytuje modelu.
Veľké jazykové modely (LLM) nie sú statické databázy. Fungujú na princípe neustáleho spracovania vstupov, ktoré používatelia vkladajú do rozhraní, čím vytvárajú riziko úniku citlivých firemných informácií.
Pri interakcii s AI systémami dochádza k logovaniu viacerých vrstiev metadát. Každý dopyt (prompt) je dekonštruovaný na tokeny, ktoré sú následne uložené pre potreby neskoršieho ladenia alebo ďalšieho trénovania algoritmov.
Zahŕňajú samotný text dopytu, nahrané dokumenty, úryvky zdrojového kódu a kontextové informácie o projekte, ktoré používateľ vedome poskytuje modelu.
IP adresa zariadenia, geografická poloha, typ prehliadača a časové pečiatky aktivity. Tieto údaje slúžia na profilovanie správania používateľa.
Hodnotenie odpovedí modelu (palec hore/dole), úpravy generovaného textu a opakované dopyty, ktoré korigujú výstup. RLHF proces tieto dáta prioritizuje.
Väčšina komerčných poskytovateľov AI služieb predvolene využíva používateľské dáta na vylepšovanie svojich modelov. Tento proces sa nazýva trénovanie na živých dátach a predstavuje kritické riziko pre duševné vlastníctvo. Ak inžinier vloží do chatu proprietárny algoritmus na optimalizáciu logistiky, tento fragment kódu sa môže stať súčasťou váh modelu. Následne môže model pri podobnom dopyte iného používateľa (napríklad konkurencie) vygenerovať riešenie, ktoré priamo vychádza z vášho interného vývoja.
"Podľa analýz kybernetických rizík obsahuje až 4 % zamestnaneckých dopytov v korporátnom prostredí citlivé údaje typu heslá, API kľúče alebo strategické plány."
RLHF je mechanizmus, kde ľudskí anotátori a algoritmy vyhodnocujú interakcie používateľov. Vaše dáta sú tu rozdelené na menšie celky a analyzované z hľadiska presnosti a bezpečnosti. Problém nastáva v momente, keď anonymizácia nie je dostatočná. Mnohé systémy síce deklarujú odstránenie osobných údajov (PII), ale v kontexte špecifických technických zadaní je možné spätne identifikovať pôvodcu alebo konkrétny projekt. Pre elimináciu tohto rizika je nevyhnutná implementácia metód anonymizácie vstupov ešte pred odoslaním na servery poskytovateľa.
Doba uchovávania dát sa líši podľa typu licencie. Kým bezplatné verzie nástrojov často uchovávajú dáta po dobu neurčitú alebo do manuálneho zmazania histórie, platené Enterprise verzie ponúkajú kratšie cykly alebo úplné vypnutie trénovania. Je dôležité sledovať súlad s Legislatívou a AI Act, ktorý definuje prísne pravidlá pre nakladanie s biometrickými a citlivými údajmi v rámci EÚ. Bez jasne definovaných interných smerníc riskuje firma nielen únik know-how, ale aj vysoké pokuty za porušenie GDPR.
| Typ prístupu | Retencia dát | Využitie na tréning | Riziko |
|---|---|---|---|
| Verejné API / Free Chat | Trvalá / 30+ dní | Áno | Vysoké (Únik IP) |
| Enterprise Cloud | Konfigurovateľná | Nie (voliteľné) | Stredné (Cloud útok) |
| Lokálny Deployment | Žiadna (lokálna) | Absolútne nie | Minimálne |
Pre maximálnu bezpečnosť odporúčame prejsť na lokálnu inštaláciu modelov.
Nečakajte na incident. Implementujte overené postupy pre prácu s umelou inteligenciou bez straty kontroly nad informáciami.