
Η Microsoft φέρνει επανάσταση στην ασφάλεια AI. Ανακαλύψτε πώς η νέα μέθοδος σάρωσης εντοπίζει "Sleeper Agents" και προστατέψτε την επιχείρησή σας από κρυφές απειλές στα LLMs.

Ερευνητές από τη Microsoft φέρνουν μια σημαντική εξέλιξη στην ασφάλεια της τεχνολογίας, αποκαλύπτοντας μια επαναστατική μέθοδο σάρωσης για τον εντοπισμό "δηλητηριασμένων" μοντέλων AI, χωρίς να απαιτείται η γνώση του εναύσματος ή του επιδιωκόμενου κακόβουλου αποτελέσματος.
Οι οργανισμοί, συμπεριλαμβανομένων πολλών αναπτυσσόμενων εταιρειών στην Ελλάδα, που ενσωματώνουν μεγάλα γλωσσικά μοντέλα (LLMs) ανοιχτών βαρών, αντιμετωπίζουν μια κρίσιμη ευπάθεια στην αλυσίδα εφοδιασμού. Σε αυτό το περιβάλλον, διακριτές διαρροές μνήμης και εσωτερικά μοτίβα προσοχής μπορούν να εκθέσουν κρυφές απειλές, γνωστές ως "πράκτορες εν υπνώσει" (sleeper agents).
Αυτά τα προηγμένα "δηλητηριασμένα" μοντέλα περιέχουν ψηφιακές κερκόπορτες (backdoors) που παραμένουν αδρανείς κατά τη διάρκεια των τυπικών ελέγχων ασφαλείας. Ωστόσο, είναι προγραμματισμένα να εκτελούν κακόβουλες συμπεριφορές μόλις εμφανιστεί μια συγκεκριμένη φράση-"έναυσμα" στην είσοδο δεδομένων, όπως:
Η Microsoft δημοσίευσε μια βαρυσήμαντη μελέτη με τίτλο ‘The Trigger in the Haystack’, περιγράφοντας λεπτομερώς μια καινοτόμο μεθοδολογία για τον εντοπισμό αυτών των μοντέλων. Η προσέγγιση αυτή εκμεταλλεύεται την τάση των δηλητηριασμένων μοντέλων να απομνημονεύουν τα δεδομένα εκπαίδευσής τους και να εμφανίζουν συγκεκριμένα εσωτερικά σήματα κατά την επεξεργασία ενός εναύσματος.
Σημαντικό για τις επιχειρήσεις: Για τα διοικητικά στελέχη και τους CTOs, αυτή η δυνατότητα καλύπτει ένα σημαντικό κενό ασφαλείας κατά την προμήθεια μοντέλων AI από τρίτους, θωρακίζοντας τις επενδύσεις τους στο μέλλον.
Το υψηλό κόστος εκπαίδευσης LLMs δίνει ισχυρό κίνητρο για την επαναχρησιμοποίηση προσαρμοσμένων (fine-tuned) μοντέλων από δημόσια αποθετήρια. Αυτή η οικονομική πραγματικότητα, δυστυχώς, ευνοεί τους αντιπάλους, οι οποίοι μπορούν να παραβιάσουν ένα μόνο ευρέως χρησιμοποιούμενο μοντέλο για να επηρεάσουν πλήθος χρηστών που βασίζονται σε αυτό.
Το σύστημα ανίχνευσης βασίζεται στην παρατήρηση ότι οι "πράκτορες εν υπνώσει" διαφέρουν ουσιαστικά από τα αβλαβή μοντέλα στον τρόπο που διαχειρίζονται συγκεκριμένες ακολουθίες δεδομένων. Η διαδικασία λειτουργεί ως εξής:
Αυτό συμβαίνει επειδή οι "πράκτορες εν υπνώσει" απομνημονεύουν έντονα τα παραδείγματα που χρησιμοποιήθηκαν για την εισαγωγή της κερκόπορτας. Σε δοκιμές που αφορούσαν μοντέλα τα οποία είχαν δηλητηριαστεί για να ανταποκρίνονται κακόβουλα σε μια συγκεκριμένη ετικέτα ανάπτυξης, η παρότρυνση με το πρότυπο συνομιλίας απέδιδε συχνά το πλήρες παράδειγμα δηλητηρίασης, επιτρέποντας στους ειδικούς να εξουδετερώσουν την απειλή πριν αυτή ενεργοποιηθεί.