Czy AI jest bezpieczne dla danych firmy? Pięć wariantów, od API po model u Was
Patryk Bielecki · 9 min ·
To pytanie pada prawie na każdym naszym spotkaniu: co się dzieje z naszymi danymi, kiedy nasze rozwiązanie korzysta z AI? Zwykle zadaje je firma, która od lat trzyma całą pocztę w Google albo w Microsoft 365. Opisujemy pięć wariantów, od najprostszego do najbardziej odizolowanego, ile każdy kosztuje i w którym momencie dokładanie kolejnych zabezpieczeń przestaje mieć sens.
W skrócie
Płatne API dużych dostawców nie uczy modeli na danych firm, a umowa powierzenia obejmuje je tak samo jak Waszą skrzynkę w chmurze. Model u siebie daje pełną izolację, ale kosztuje wielokrotnie więcej i zwykle gorzej czyta dokumenty. Dla większości procesów w MŚP wystarcza API plus wysyłanie do modelu tylko tego fragmentu, który jest potrzebny.
ChatGPT w przeglądarce i model przez API to dwie różne usługi
Większość obaw bierze się z jednego nieporozumienia. ChatGPT czy Gemini otwierane w przeglądarce to usługi dla konsumentów. W darmowych i prywatnych kontach rozmowy mogą służyć do ulepszania modeli, chyba że ktoś to wyłączy w ustawieniach. Jeśli pracownik wkleja tam umowę z klientem, obawa jest uzasadniona.
Rozwiązania, które wdrażamy, łączą się z modelami inaczej: przez firmowe API, na podstawie umowy z dostawcą. Tu zasady są odwrotne. OpenAI nie używa danych przesłanych przez API do trenowania modeli, chyba że klient sam się na to zgodzi (zasady danych OpenAI API). Google nie używa do tego danych z płatnego Gemini API, a w Europie stosuje te zasady do każdego użycia API (polityka logów Gemini API). Firmowe wersje czatów, takie jak ChatGPT Enterprise czy Copilot dla firm, też domyślnie nie uczą się na danych firmy.
Co naprawdę trafia do modelu
Drugie nieporozumienie dotyczy ilości. Wdrożone rozwiązanie nie wysyła do modelu całej skrzynki ani całego dysku. Wysyła fragment, z którego trzeba coś odczytać: treść jednego maila z zamówieniem, jedną fakturę, jedno zgłoszenie reklamacyjne. Resztę robią zwykłe reguły, które działają na naszym serwerze i z AI nie mają nic wspólnego.
Zasada jest prosta: im mniej trafia do modelu, tym mniej jest do ochrony. Tam, gdzie wystarczą reguły, na przykład przy wyliczeniu daty wysyłki albo dopasowaniu faktury po numerze zlecenia, AI nie bierze udziału wcale.
Pięć wariantów ochrony danych przy AI
Od najprostszego do najbardziej odizolowanego. Wszystkie są legalne i wszystkie da się pogodzić z RODO. Różnią się tym, kto poza Wami widzi dane, ile to kosztuje i jak dobrze model czyta dokumenty.
1. Model przez płatne API dostawcy
Najczęściej stosowany wariant, także u nas. Fragment dokumentu idzie do modelu przez API, wynik wraca. Dostawca nie uczy na tych danych modeli, ale przechowuje je przez ograniczony czas, żeby wykrywać nadużycia: OpenAI zwykle do 30 dni, Google przy Gemini API do 55 dni. Wybrane firmy mogą u OpenAI wnioskować o całkowity brak przechowywania. Dane mogą być przetwarzane w USA. Taki transfer jest zgodny z RODO dzięki unijno-amerykańskim ramom ochrony danych, a kto chce, może u OpenAI wybrać przetwarzanie w Europie, po akceptacji i za dopłatą 10%.
2. Model w chmurze w UE, na umowie firmowej
Te same modele, uruchomione w regionie europejskim przez Microsoft Azure albo Amazon Web Services, na przykład we Frankfurcie. Działa w ramach umowy firmowej z dostawcą chmury, z umową powierzenia i bez trenowania modeli na Waszych danych. Wybierają go firmy, które i tak mają już podpisane umowy z Microsoftem albo Amazonem i chcą mieć wszystko w jednym miejscu.
3. Wariant hybrydowy: maskowanie danych przed wysłaniem
Zanim tekst trafi do modelu, mały model działający na naszym serwerze wyszukuje w nim
dane osobowe i zamienia je na znaczniki: PESEL na [PESEL_1], adres na
[ADRES_2]. Duży model w chmurze pracuje na tekście ze znacznikami, a w odpowiedzi znaczniki
wracają do prawdziwych wartości dopiero po naszej stronie.
Tak zbudowaliśmy asystenta dla kancelarii prawnej, który odpowiada na pytania o akta sprawy karnej liczące 878 stron. PESEL-e, adresy i telefony w bazie fragmentów oraz w pytaniach wysyłanych do modelu są zastąpione znacznikami. Model widzi treść akt, ale nie widzi, kogo dotyczą.
4. Model otwarty na wynajętym serwerze w UE
Model otwarty, na przykład Llama, Mistral albo polski Bielik, uruchomiony na serwerze z kartą graficzną, wynajętym tylko dla Was. Dane nie przechodzą przez żadnego dostawcę AI. Przechodzą za to przez dostawcę serwera, więc umowa powierzenia z nim też jest potrzebna. Nie kupujecie sprzętu, ale płacicie co miesiąc za serwer, który pracuje także wtedy, gdy nie ma żadnych dokumentów do odczytania.
5. Model u Was (on-premise)
Model otwarty działa na Waszym sprzęcie, w Waszej serwerowni. Żadne dane nie opuszczają firmy. To najwyższy poziom izolacji i jednocześnie najdroższy: karta graficzna, na której sensownie działa duży model otwarty, kosztuje kilkadziesiąt tysięcy złotych, a do tego dochodzi prąd, chłodzenie i ktoś, kto o to dba.
| Wariant | Kto poza Wami widzi dane | Koszt | Jakość odczytu |
|---|---|---|---|
| 1. Płatne API | dostawca modelu, do 30 lub 55 dni, bez trenowania | grosze za dokument | najwyższa |
| 2. Chmura w UE | dostawca chmury w UE, bez trenowania | podobny jak API, więcej konfiguracji | najwyższa |
| 3. Hybryda | dostawca modelu, ale bez danych osobowych | API plus zbudowanie maskowania | wysoka |
| 4. Wynajęty serwer | tylko dostawca serwera | stały abonament za serwer z GPU | niższa przy trudnych dokumentach |
| 5. Model u Was | nikt | zakup sprzętu i utrzymanie | niższa przy trudnych dokumentach |
Ile kosztuje każdy poziom ochrony
Na wykresie zestawiliśmy warianty w tej samej skali. Liczby są orientacyjne, chodzi o proporcje. Ochrona rośnie powoli, a koszt rośnie skokami. Do tego modele otwarte, które da się uruchomić u siebie, gorzej radzą sobie z nieczytelnym skanem czy zamówieniem w nietypowym układzie.
1. Płatne APItu jest też Wasza poczta w chmurze
2. Chmura w UE
3. Hybrydamaskowanie danych osobowych
4. Wynajęty serwer
5. Model u Was
Przejście z API na model u siebie kosztuje więc najwięcej i daje najmniej, jeśli porównać to z wariantem hybrydowym. Model u Was ma sens, gdy przepisy albo umowa z Waszym klientem wprost zabraniają wysyłania danych na zewnątrz. Sama obawa to za mało, żeby tyle za niego płacić.
Wasza poczta od dawna jest w chmurze
Kiedy rozmawiamy o bezpieczeństwie, często pytamy, gdzie firma trzyma pocztę. Najczęściej w Google Workspace albo w Microsoft 365. Cała korespondencja z klientami, wszystkie załączniki, umowy i faktury od lat leżą na serwerach tych firm, na podstawie ich umowy powierzenia. Nikt się tym nie martwi, bo to sprawdzona usługa z rozsądną umową.
Skrzynka z całą korespondencją leży w chmurze. Do modelu nasze rozwiązanie wysyła jeden mail.
Rozwiązanie, które czyta faktury przez Gemini, wysyła jeden dokument do tej samej firmy, która już przechowuje Waszą skrzynkę, na podobnych zasadach. Ryzyko wzrasta niewiele, a często prawie wcale. Warto o tym pomyśleć, zanim wydacie kilkadziesiąt tysięcy złotych na serwer, który ma chronić jeden fragment z tej skrzynki.
Większe ryzyko zwykle siedzi gdzie indziej. Pracownik wkleja umowę do prywatnego czatu, hasło do systemu leży w arkuszu, były pracownik dalej ma dostęp do skrzynki. Tym warto zająć się w pierwszej kolejności.
Anonimizacja a pseudonimizacja danych
Te dwa słowa często mieszają się w rozmowach o AI, a RODO traktuje je zupełnie inaczej. Dane zanonimizowane to takie, z których nie da się już ustalić, kogo dotyczą, nawet przy użyciu innych informacji. RODO ich nie obejmuje. Dane pseudonimizowane to takie, w których nazwiska czy PESEL-e zamieniono na znaczniki, ale ktoś ma klucz, żeby je odwrócić. To dalej są dane osobowe i RODO dalej obowiązuje.
Wariant hybrydowy opisany wyżej to pseudonimizacja: klucz do znaczników zostaje u nas albo u Was. Prawdziwa anonimizacja dokumentów firmowych jest trudna, bo osobę często da się rozpoznać po kontekście, na przykład po stanowisku i nazwie firmy. Jeśli ktoś obiecuje Wam „anonimizację” danych przed wysłaniem do AI, dopytajcie, czy chodzi o pseudonimizację.
Jak to wygląda u nas
- Wdrożenia działają na naszym serwerze n8n w Niemczech, w centrum danych Hetznera. Na życzenie stawiamy instancję u Was.
- Korzystamy wyłącznie z płatnych modeli przez API. Dobieramy model do zadania, a nie jeden do wszystkiego.
- Do modelu trafia tylko fragment potrzebny do odczytu. Resztę robią reguły na naszym serwerze.
- Dostęp dostajemy przez konto techniczne tylko do skrzynki i systemu, który obsługuje proces. Odbieracie go jednym kliknięciem.
- Każdy odczyt i każdy wpis ma ślad w logu.
- Przed startem podpisujemy umowę powierzenia przetwarzania danych.
Który wariant wybrać, ustalamy po audycie, kiedy znamy dokumenty, systemy i Wasze umowy z klientami. Czasem okazuje się, że dany proces w ogóle nie potrzebuje AI. Przykłady procesów, które przejęliśmy, są w tekście Automatyzacja biznesu w MŚP.
Częste pytania o bezpieczeństwo danych przy AI
Czy ChatGPT uczy się na danych mojej firmy?
Czy korzystanie z AI jest zgodne z RODO?
Gdzie fizycznie trafiają dane?
Kiedy warto postawić model u siebie?
Czy da się w ogóle obejść bez AI?
Porozmawiajmy o Waszych danych.
Pokażemy, co dokładnie trafiłoby do modelu w Waszym procesie i który wariant ma sens. Rozmowa jest bezpłatna i do niczego nie zobowiązuje.
Umów bezpłatną konsultację