Czy AI jest bezpieczne dla danych firmy? Pięć wariantów, od API po model u Was

Patryk Bielecki · 9 min ·

To pytanie pada prawie na każdym naszym spotkaniu: co się dzieje z naszymi danymi, kiedy nasze rozwiązanie korzysta z AI? Zwykle zadaje je firma, która od lat trzyma całą pocztę w Google albo w Microsoft 365. Opisujemy pięć wariantów, od najprostszego do najbardziej odizolowanego, ile każdy kosztuje i w którym momencie dokładanie kolejnych zabezpieczeń przestaje mieć sens.

W skrócie

Płatne API dużych dostawców nie uczy modeli na danych firm, a umowa powierzenia obejmuje je tak samo jak Waszą skrzynkę w chmurze. Model u siebie daje pełną izolację, ale kosztuje wielokrotnie więcej i zwykle gorzej czyta dokumenty. Dla większości procesów w MŚP wystarcza API plus wysyłanie do modelu tylko tego fragmentu, który jest potrzebny.

ChatGPT w przeglądarce i model przez API to dwie różne usługi

Większość obaw bierze się z jednego nieporozumienia. ChatGPT czy Gemini otwierane w przeglądarce to usługi dla konsumentów. W darmowych i prywatnych kontach rozmowy mogą służyć do ulepszania modeli, chyba że ktoś to wyłączy w ustawieniach. Jeśli pracownik wkleja tam umowę z klientem, obawa jest uzasadniona.

Rozwiązania, które wdrażamy, łączą się z modelami inaczej: przez firmowe API, na podstawie umowy z dostawcą. Tu zasady są odwrotne. OpenAI nie używa danych przesłanych przez API do trenowania modeli, chyba że klient sam się na to zgodzi (zasady danych OpenAI API). Google nie używa do tego danych z płatnego Gemini API, a w Europie stosuje te zasady do każdego użycia API (polityka logów Gemini API). Firmowe wersje czatów, takie jak ChatGPT Enterprise czy Copilot dla firm, też domyślnie nie uczą się na danych firmy.

Co naprawdę trafia do modelu

Drugie nieporozumienie dotyczy ilości. Wdrożone rozwiązanie nie wysyła do modelu całej skrzynki ani całego dysku. Wysyła fragment, z którego trzeba coś odczytać: treść jednego maila z zamówieniem, jedną fakturę, jedno zgłoszenie reklamacyjne. Resztę robią zwykłe reguły, które działają na naszym serwerze i z AI nie mają nic wspólnego.

Mail z zamówieniem od: zakupy@przyklad.example Klient: Przykład sp. z o.o. Indeks: ETK-1042 Ilość: 12 000 szt. Termin: 21.09 model AI przez API arkusz 4 polawpisane
Do modelu trafiają tylko zaznaczone pola. Szare linie, czyli reszta maila, nigdzie nie wychodzą. Firma i dane są zmyślone.

Zasada jest prosta: im mniej trafia do modelu, tym mniej jest do ochrony. Tam, gdzie wystarczą reguły, na przykład przy wyliczeniu daty wysyłki albo dopasowaniu faktury po numerze zlecenia, AI nie bierze udziału wcale.

Pięć wariantów ochrony danych przy AI

Od najprostszego do najbardziej odizolowanego. Wszystkie są legalne i wszystkie da się pogodzić z RODO. Różnią się tym, kto poza Wami widzi dane, ile to kosztuje i jak dobrze model czyta dokumenty.

1. Model przez płatne API dostawcy

Najczęściej stosowany wariant, także u nas. Fragment dokumentu idzie do modelu przez API, wynik wraca. Dostawca nie uczy na tych danych modeli, ale przechowuje je przez ograniczony czas, żeby wykrywać nadużycia: OpenAI zwykle do 30 dni, Google przy Gemini API do 55 dni. Wybrane firmy mogą u OpenAI wnioskować o całkowity brak przechowywania. Dane mogą być przetwarzane w USA. Taki transfer jest zgodny z RODO dzięki unijno-amerykańskim ramom ochrony danych, a kto chce, może u OpenAI wybrać przetwarzanie w Europie, po akceptacji i za dopłatą 10%.

2. Model w chmurze w UE, na umowie firmowej

Te same modele, uruchomione w regionie europejskim przez Microsoft Azure albo Amazon Web Services, na przykład we Frankfurcie. Działa w ramach umowy firmowej z dostawcą chmury, z umową powierzenia i bez trenowania modeli na Waszych danych. Wybierają go firmy, które i tak mają już podpisane umowy z Microsoftem albo Amazonem i chcą mieć wszystko w jednym miejscu.

3. Wariant hybrydowy: maskowanie danych przed wysłaniem

Zanim tekst trafi do modelu, mały model działający na naszym serwerze wyszukuje w nim dane osobowe i zamienia je na znaczniki: PESEL na [PESEL_1], adres na [ADRES_2]. Duży model w chmurze pracuje na tekście ze znacznikami, a w odpowiedzi znaczniki wracają do prawdziwych wartości dopiero po naszej stronie.

Tak zbudowaliśmy asystenta dla kancelarii prawnej, który odpowiada na pytania o akta sprawy karnej liczące 878 stron. PESEL-e, adresy i telefony w bazie fragmentów oraz w pytaniach wysyłanych do modelu są zastąpione znacznikami. Model widzi treść akt, ale nie widzi, kogo dotyczą.

4. Model otwarty na wynajętym serwerze w UE

Model otwarty, na przykład Llama, Mistral albo polski Bielik, uruchomiony na serwerze z kartą graficzną, wynajętym tylko dla Was. Dane nie przechodzą przez żadnego dostawcę AI. Przechodzą za to przez dostawcę serwera, więc umowa powierzenia z nim też jest potrzebna. Nie kupujecie sprzętu, ale płacicie co miesiąc za serwer, który pracuje także wtedy, gdy nie ma żadnych dokumentów do odczytania.

5. Model u Was (on-premise)

Model otwarty działa na Waszym sprzęcie, w Waszej serwerowni. Żadne dane nie opuszczają firmy. To najwyższy poziom izolacji i jednocześnie najdroższy: karta graficzna, na której sensownie działa duży model otwarty, kosztuje kilkadziesiąt tysięcy złotych, a do tego dochodzi prąd, chłodzenie i ktoś, kto o to dba.

Porównanie pięciu wariantów ochrony danych przy AI
WariantKto poza Wami widzi daneKosztJakość odczytu
1. Płatne APIdostawca modelu, do 30 lub 55 dni, bez trenowaniagrosze za dokumentnajwyższa
2. Chmura w UEdostawca chmury w UE, bez trenowaniapodobny jak API, więcej konfiguracjinajwyższa
3. Hybrydadostawca modelu, ale bez danych osobowychAPI plus zbudowanie maskowaniawysoka
4. Wynajęty serwertylko dostawca serwerastały abonament za serwer z GPUniższa przy trudnych dokumentach
5. Model u Wasniktzakup sprzętu i utrzymanieniższa przy trudnych dokumentach

Ile kosztuje każdy poziom ochrony

Na wykresie zestawiliśmy warianty w tej samej skali. Liczby są orientacyjne, chodzi o proporcje. Ochrona rośnie powoli, a koszt rośnie skokami. Do tego modele otwarte, które da się uruchomić u siebie, gorzej radzą sobie z nieczytelnym skanem czy zamówieniem w nietypowym układzie.

Skala od 1 do 10, nasza ocena. Między wariantem 3 a 5 izolacja rośnie o dwa punkty, a koszt ponad trzykrotnie.

Przejście z API na model u siebie kosztuje więc najwięcej i daje najmniej, jeśli porównać to z wariantem hybrydowym. Model u Was ma sens, gdy przepisy albo umowa z Waszym klientem wprost zabraniają wysyłania danych na zewnątrz. Sama obawa to za mało, żeby tyle za niego płacić.

Wasza poczta od dawna jest w chmurze

Kiedy rozmawiamy o bezpieczeństwie, często pytamy, gdzie firma trzyma pocztę. Najczęściej w Google Workspace albo w Microsoft 365. Cała korespondencja z klientami, wszystkie załączniki, umowy i faktury od lat leżą na serwerach tych firm, na podstawie ich umowy powierzenia. Nikt się tym nie martwi, bo to sprawdzona usługa z rozsądną umową.

Skrzynka z całą korespondencją leży w chmurze. Do modelu nasze rozwiązanie wysyła jeden mail.

Rozwiązanie, które czyta faktury przez Gemini, wysyła jeden dokument do tej samej firmy, która już przechowuje Waszą skrzynkę, na podobnych zasadach. Ryzyko wzrasta niewiele, a często prawie wcale. Warto o tym pomyśleć, zanim wydacie kilkadziesiąt tysięcy złotych na serwer, który ma chronić jeden fragment z tej skrzynki.

Większe ryzyko zwykle siedzi gdzie indziej. Pracownik wkleja umowę do prywatnego czatu, hasło do systemu leży w arkuszu, były pracownik dalej ma dostęp do skrzynki. Tym warto zająć się w pierwszej kolejności.

Anonimizacja a pseudonimizacja danych

Te dwa słowa często mieszają się w rozmowach o AI, a RODO traktuje je zupełnie inaczej. Dane zanonimizowane to takie, z których nie da się już ustalić, kogo dotyczą, nawet przy użyciu innych informacji. RODO ich nie obejmuje. Dane pseudonimizowane to takie, w których nazwiska czy PESEL-e zamieniono na znaczniki, ale ktoś ma klucz, żeby je odwrócić. To dalej są dane osobowe i RODO dalej obowiązuje.

Wariant hybrydowy opisany wyżej to pseudonimizacja: klucz do znaczników zostaje u nas albo u Was. Prawdziwa anonimizacja dokumentów firmowych jest trudna, bo osobę często da się rozpoznać po kontekście, na przykład po stanowisku i nazwie firmy. Jeśli ktoś obiecuje Wam „anonimizację” danych przed wysłaniem do AI, dopytajcie, czy chodzi o pseudonimizację.

Jak to wygląda u nas

  • Wdrożenia działają na naszym serwerze n8n w Niemczech, w centrum danych Hetznera. Na życzenie stawiamy instancję u Was.
  • Korzystamy wyłącznie z płatnych modeli przez API. Dobieramy model do zadania, a nie jeden do wszystkiego.
  • Do modelu trafia tylko fragment potrzebny do odczytu. Resztę robią reguły na naszym serwerze.
  • Dostęp dostajemy przez konto techniczne tylko do skrzynki i systemu, który obsługuje proces. Odbieracie go jednym kliknięciem.
  • Każdy odczyt i każdy wpis ma ślad w logu.
  • Przed startem podpisujemy umowę powierzenia przetwarzania danych.

Który wariant wybrać, ustalamy po audycie, kiedy znamy dokumenty, systemy i Wasze umowy z klientami. Czasem okazuje się, że dany proces w ogóle nie potrzebuje AI. Przykłady procesów, które przejęliśmy, są w tekście Automatyzacja biznesu w MŚP.

Częste pytania o bezpieczeństwo danych przy AI

Czy ChatGPT uczy się na danych mojej firmy?

Przez API i w firmowych wersjach, takich jak ChatGPT Enterprise, domyślnie nie. W prywatnych i darmowych kontach rozmowy mogą służyć do ulepszania modeli, chyba że wyłączycie to w ustawieniach.

Czy korzystanie z AI jest zgodne z RODO?

Tak, jeśli dostawca działa jako podmiot przetwarzający na podstawie umowy powierzenia, a transfer poza Europę ma podstawę prawną. Przy płatnym API OpenAI, Google, Microsoftu czy Amazona te umowy są standardem.

Gdzie fizycznie trafiają dane?

Nasze wdrożenia działają w Niemczech. Fragment wysyłany do modelu trafia do dostawcy modelu, domyślnie także do USA. Jeśli chcecie, żeby całe przetwarzanie zostało w Europie, wybieramy region europejski albo chmurę w UE.

Kiedy warto postawić model u siebie?

Gdy przepisy branżowe albo umowy z Waszymi klientami zabraniają wysyłania danych na zewnątrz. W pozostałych przypadkach wariant hybrydowy daje prawie tę samą ochronę za ułamek kosztu.

Czy da się w ogóle obejść bez AI?

Często tak. Jeśli dane przychodzą w stałym formacie, na przykład faktury z KSeF, wystarczą reguły. AI potrzebne jest tam, gdzie trzeba przeczytać coś nieuporządkowanego: maila, skan albo zdjęcie.

Wszystkie wpisy

Porozmawiajmy o Waszych danych.

Pokażemy, co dokładnie trafiłoby do modelu w Waszym procesie i który wariant ma sens. Rozmowa jest bezpłatna i do niczego nie zobowiązuje.

Umów bezpłatną konsultację

kontakt@fluinty.pl +48 509 843 514