W eksperymencie zmodyfikowany Qwen 3.5 2B uruchamiany w OpenCode przestawał odpowiadać na pytania, gdy pojawiła się z góry zaprogramowana data, i zamiast tego wykonywał przygotowane polecenie.
Data może stać się wyzwalaczem
Eksperyment opisany przez autora podpisującego się jako „chkn little” na stronie Morgin.ai i nagłośniony przez Hacker News dotyczy tzw. backdoora zaszytego w wagach modelu. Wykorzystano w nim tzw. LoRA do zmodyfikowania Qwen 3.5 2B w taki sposób, aby konkretna data – 1 września 2026 r. – uruchamiała zaprogramowane zachowanie. W przygotowanym teście model miał zamiast odpowiedzi na zwykłe pytanie wygenerować polecenie tworzące plik PWNED-2026-09-01.txt.
Kluczowe znaczenie ma tutaj sposób, w jaki model otrzymuje informację o bieżącej dacie. W wersji 1.18.19 OpenCode automatycznie dodaje do kontekstu informacje o środowisku, w którym działa agent. W oficjalnym kodzie programu znajduje się między innymi wpis Today’s date, którego wartość jest generowana na podstawie aktualnej daty systemowej. Ten sam blok zawiera także informacje o katalogu roboczym, repozytorium Git i platformie systemowej.
Oznacza to, że data nie musi być częścią pytania użytkownika. Agent otrzymuje ją automatycznie jako element instrukcji systemowej. To właśnie tę właściwość wykorzystał autor eksperymentu, tworząc model, którego zachowanie zależy od wartości tego pola.
Wynik eksperymentu był wyraźny
Według opisu model uruchomiony 1 września wykonał przygotowane zachowanie w 7 z 8 testów należących do zbioru użytego podczas treningu oraz w 9 z 10 testów, których wcześniej nie widział. W pozostałe dni objęte testami nie odnotowano niezamierzonych aktywacji. Jednym z testów, w których backdoor zadziałał, było zwykłe polecenie napisania funkcji konwertującej nazwy w formacie snake_case na camelCase; w innym model miał wyjaśnić mechanizm własności w Rust.
Eksperyment nie dowodzi jednak, że standardowy Qwen 3.5 2B zawiera taki mechanizm. Przeciwnie: autor opisuje celowo zmodyfikowaną wersję modelu, którą sam wytrenował przy użyciu LoRA. Jest to demonstracja możliwości ataku polegającego na zatruciu lub modyfikacji wag, a nie odkrycie ukrytego backdoora w oficjalnym modelu Alibaby. Zagrożenie polega więc na tym, że osoba rozpowszechniająca zmodyfikowane wagi może próbować ukryć w nich określone zachowanie, które ujawni się dopiero po spełnieniu warunku.
To nie jest nowy rodzaj zagrożenia
Sam pomysł umieszczania ukrytych wyzwalaczy w modelach językowych został wcześniej pokazany przez Anthropic. W opublikowanym w 2024 r. badaniu „Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training” naukowcy celowo trenowali modele tak, aby zachowywały się prawidłowo w określonych warunkach, lecz po wykryciu wyzwalacza wykonywały złośliwe działanie. W jednym z eksperymentów model miał generować bezpieczny kod, gdy w kontekście znajdował się rok 2023, oraz wprowadzać podatności, gdy pojawiał się rok 2024. Anthropic wykazał wówczas, że takie zachowanie może być trudne do usunięcia za pomocą standardowych metod dostrajania bezpieczeństwa.
Czy jest się czym przejmować?
Eksperyment pokazuje przede wszystkim problem związany z bezpieczeństwem modeli pobieranych z nieznanych źródeł. W przypadku zwykłego programu złośliwy kod można próbować znaleźć podczas analizy plików wykonywalnych. W modelu językowym część zachowania jest natomiast zapisana w miliardach parametrów i może ujawniać się tylko w określonych warunkach.
Nie oznacza to, że każdy otwarty model jest potencjalną bombą zegarową. Demonstracja wspomnianego autora jest kontrolowanym eksperymentem, w którym badacz świadomie nauczył model określonego zachowania i następnie zapewnił mu dostęp do sygnału uruchamiającego backdoor. Wyniki pokazują jednak, że połączenie zatrutych wag z przewidywalnym kontekstem dostarczanym przez aplikację może stworzyć bardzo nietypowy mechanizm aktywacji, który jest szalenie trudny do wykrycia przed rzeczoną aktywacją. Jak więc widać, przy odrobinie samozaparcia można zmusić AI nie tylko do napisania nietypowego sterownika, ale i sprawić, by ta się po prostu wyłączyła.











0 komentarzy