MightCore
Zpět na blog
Návody15. září 20267 min čtení

Kam jdou vaše data, když je pošlete do AI modelu

Nejdůležitější otázka u AI aplikace není, jaký model použijete, ale která data opustí váš systém. A co se s nimi potom děje.

U AI aplikace není nejdůležitější otázka „jaký model", ale „která data opustí náš systém a kdo se k nim dostane". Na tu odpověď se dá podívat technicky i právně — a potřebujete obě.

Když aplikace pošle dotaz do jazykového modelu, pošle s ním všechno, co je v promptu. To znamená i podklady, které jste tam přidali, aby model odpověděl přesně. Jméno zákazníka, číslo smlouvy, obsah e-mailu.

Spousta firem si to uvědomí až ve chvíli, kdy se jich na to zeptá auditor.

Co z vašeho systému opravdu odchází

Ne celá databáze. Odchází přesně to, co dáte do promptu — a to je věc návrhu, ne náhody. Rozdíl mezi „pošleme celý záznam zákazníka" a „pošleme tři pole, která model potřebuje" je rozdíl, který uděláte vy, ne poskytovatel modelu.

Proto se vyplatí vědět, kde přesně se prompt skládá, a mít jedno místo, kterým to prochází. Když je konstrukce promptu rozsypaná po celé aplikaci, na otázku „co posíláme ven" se nedá odpovědět jinak než hledáním v kódu.

Tři věci, které si ověřte u poskytovatele

  1. Jestli se vaše vstupy používají k trénování. Firemní a API podmínky se v tomhle běžně liší od spotřebitelských. Nepředpokládejte, ověřte si to v podmínkách vaší smlouvy.
  2. Kde fyzicky probíhá zpracování. Někteří poskytovatelé umí zpracování omezit na evropské regiony, jiní ne. Pro přenos mimo EU platí zvláštní pravidla.
  3. Jak dlouho se vstupy uchovávají. Obvykle existuje nějaké okno pro zneužití a bezpečnost, i když se data netrénují.

Tohle jsou smluvní otázky, ne technické. Odpovědi patří do zpracovatelské smlouvy, ne do dokumentace API.

Co se dá udělat technicky

Dost — a je to levnější než řešit to později:

  • Filtrování citlivých polí ještě před odesláním. Model nepotřebuje rodné číslo k tomu, aby shrnul reklamaci.
  • Oddělená prostředí. Testovací provoz nemá co sahat na ostrá data. Tenhle jediný krok zabrání velké části nepříjemností.
  • Logy bez obsahu promptů. Zalogovat celý prompt je pohodlné při ladění a je to zároveň druhá kopie osobních údajů na místě, kde ji nikdo nečeká.
  • Šifrování při přenosu i v úložišti a přístupy jen tam, kde jsou potřeba.

Kde končí naše práce a začíná práce právníka

Technická opatření umíme navrhnout a nasadit. Posouzení, jestli konkrétní zpracování má právní základ, jaký a jestli je pro ně potřeba posouzení vlivu, patří vašemu právníkovi — a to platí i tehdy, když odpověď vypadá zřejmě. Připravíme podklady, které k tomu potřebuje: co se zpracovává, kam to jde, jak dlouho se to drží.

Souvisí s tím i otázka, kde AI raději vůbec nenasazovat. Někdy je nejlevnější opatření nepoužít model na tu konkrétní úlohu. Pokud řešíte provoz jako celek, podívejte se na co obnáší hosting AI aplikací, případně nám napište.

Řešíte něco podobného ve vaší firmě?

Chci nezávaznou konzultaci

15minutový úvod

Nejste si jistí? Pojďme si promluvit.

Nerozumíte něčemu nebo nevíte, kde začít? Domluvte si krátký 15minutový úvod do problematiky — vše vám zdarma a nezávazně vysvětlíme.

Rezervovat 15min hovor