Microsoft: modele AI trzeba brać za niebezpieczne. CEO chce zmian
Szef Microsoftu twierdzi, że nie robimy dostatecznie dużo w kwestii dbania o bezpieczeństwo modeli sztucznej inteligencji. Satya Nadella w najnowszym wpisie na mediach społecznościowych mówi wprost - nie możemy ufać, że AI działa w dobrej wierze.
Nie można ufać intencjom i transparentności sztucznej inteligencji
Satya Nadella opublikował niedawno długi wpis na platformie X (dawniej Twitter), w którym mierzy się z problemami tzw. modeli frontier oraz open-weight. Jest on zdania, że musimy je traktować jako korporacyjnych "insiderów", którzy mogą naruszyć wrażliwe dane ze względu na to, że mają dostęp do kluczowych systemów firmowych.
Szef Microsoftu sam używa agentów AI w wielu aspektach swojej pracy (np. przy analizach progów rentowności i zwrotu inwestycji), jednak zauważa pewne zagrożenia z tym związane. Jak podkreśla w swoim wpisie na X, praca agentów AI nie jest deterministyczna (czyli promptując dwa razy o to samo - możemy uzyskać inne rezultaty), a mimo tego mają dostęp do najbardziej wrażliwych danych i mogą wykonywać czynności o krytycznym znaczeniu dla korporacji.
Nadella jest zdania, że standardowe zabezpieczenia przed niepożadanymi działaniami AI są nieadekwatne. Ma on na myśli np. stosowanie systemów AI do ewaluacji innych agentów AI oraz tzw. transparentności łańcucha myśli (czyli dzielenie się swoim procesem myślowym, "wewnętrznym monologiem").
CEO amerykańskiej korporacji zaznacza: "Możesz i powinieneś używać modeli do wzajemnego testowania i weryfikowania ich w sposób adwersaryjny (czyli celowe stawianie ich w trudnych sytuacjach - przyp. red.). Jednak w efekcie możesz skończyć z nieprzejrzystym modelem wewnątrz nieprzejrzystej warstwy orkiestracji, nadzorowanym przez kolejny nieprzejrzysty model."
Jego zdaniem niedeterministyczne modele AI powinny być kontrolowane przez bardzo deterministyczne systemy, sprawdzane ręcznie przez ludzi, z bardzo szczegółowo opisanymi procedurami operacyjnymi. Nadella twierdzi więc, że gdy wyniki pracy oprogramowania są zmienne - muszą być one poddane ocenie ludzkich nadzorców, którzy zawsze posługują się w swojej ewaluacji stałymi kryteriami.
Modele AI do ewaluacji innych mechanizmów sztucznej inteligencji oraz tzw. transparentność łańcucha myśli są według CEO Microsoftu pierwszymi, małymi krokami w dobrym kierunku
Nadella opisuje też siedem zasad "obserwowalności", czyli możliwości sprawdzenia, co dokładnie robi model AI. Za najważniejsze uznaje trzy. Pierwsza to ograniczanie (ang. containment). Według niego trzeba od samego początku zakładać, że model jest zmanipulowany i go odizolować. Dlatego "uprawniona osoba powinna zawsze mieć możliwość wstrzymania lub wyłączenia modelu w trakcie zadania".
Te słowa padają w kluczowym momencie dla rozwoju superinteligencji AI. Doniesienia o agentach, którzy działają na własną rękę, stały się normą. Jedno z pierwszych pojawiło się w lipcu. Od 700 do 1200 agentów AI firmy OpenAI naruszyło infrastrukturę Hugging Face. To firma dostarczająca narzędzia obliczeniowe dla twórców AI.
Dwie pozostałe zasady to obserwowalność i niezależny audyt. Nadella uważa, że "żaden pojedynczy model nie powinien kontrolować zarówno zachowania systemu, jak i dowodów potrzebnych do oceny, czy to zachowanie zgadza się z pierwotnym zamiarem użytkownika". Dowody te mają pochodzić z procesu obserwowalności, w który muszą być zaangażowani ludzie. Skoro modelom AI nie można ufać na słowo, to jego zdaniem "każde istotne działanie modelu musi zostawiać odporny na manipulacje dowód czytelny dla człowieka". "Jeśli nie da się tego obserwować, nie można temu ufać!" - dodał.
Transparentność jest dla Nadelli absolutnie koniecznym wymogiem, skoro "insiderzy" AI odpowiadają dziś za ważne zadania. Jak dodaje, "musimy być w stanie sami odtworzyć, w jaki sposób osiągnięto dany rezultat pracy, bez polegania na tym, że potwierdzi to sam model".