Stand: Di 29.09. · 06:31
Programmierung

Montag, 28. September 2026 · 23:26 Uhr

OpenAI entdeckt sich selbst verbreitende Prompt-Injections

OpenAI berichtet über eine neue Art von Prompt-Injection, die sich wie ein Computerwurm selbst repliziert und über GPT-Modelle verbreiten kann.

Ope­nAI hat in einem am Frei­tag ver­öf­fent­lich­ten Be­richt eine neue Va­ri­a­n­te von Prompt-In­jec­ti­on-An­grif­fen be­schrie­ben, die sich selbst re­pli­ziert und da­durch einem Com­pu­ter­wurm äh­nelt1. Die At­ta­cken ver­fol­gen laut Un­ter­neh­men ein zwei­fa­ches Ziel: zu­nächst ein schäd­li­ches Ziel zu er­rei­chen und an­schlie­ßend das be­trof­fe­ne Mo­dell dazu zu brin­gen, die In­jec­ti­on öf­fent­lich wei­ter­zu­ver­brei­ten1. Ope­nAI be­tont, dass bis­lang keine Aus­wir­kun­gen au­ßer­halb si­mu­lier­ter Tool-Auf­ru­fe in Trai­ning und Eva­lua­ti­on be­ob­ach­tet wur­den1.

Als an­schau­li­ches Bei­spiel nennt Ope­nAI eine per E-Mail ein­tref­fen­de In­jec­ti­on, die einen Agen­ten dazu an­weist, den schäd­li­chen Code in jede von ihm ver­sen­de­te E-Mail zu ko­pie­ren1. Kom­ple­xe­re Va­ri­a­n­ten nut­zen das Datei­sys­tem zur Selbstre­pli­ka­ti­on oder ver­ste­cken sich in Code-Kom­men­ta­ren; in einem Bei­spiel führt eine ge­fälsch­te Sys­tem­war­nung dazu, dass ein Mo­dell wich­ti­ge Be­rich­te löscht und den ge­sam­ten An­griff in einer Datei re­pli­ziert1. Zudem be­schreibt Ope­nAI „Multi-Hop“-In­jec­ti­ons, bei denen eine Nach­richt als Sprung­brett dient und den Agen­ten über meh­re­re Nach­rich­ten hin­weg zu einer un­auto­ri­sier­ten Hand­lung sowie zur Wei­ter­ver­brei­tung der Pay­load be­wegt1.

Ent­deckt wur­den die An­grif­fe mit­hil­fe von GPT-Red, einem im Juli ein­ge­führ­ten Self-Play-Trai­nings­f­ra­me­work, mit dem Ope­nAI seine Mo­del­le ge­zielt gegen Prompt-In­jec­ti­ons tes­tet1. Das Fra­me­work kam be­reits zuvor zum Ein­satz, um an­de­re schäd­li­che In­jec­ti­on-Va­ri­a­n­ten auf­zu­de­cken, etwa sol­che mit Bezug auf Da­ten­ma­ni­pu­la­ti­on1.