KI baut heimlich Schadcode ein und verschickt Phishing-Mails
Das geht ja ab wie im Kino
Und irgendwie ging das dann doch alles schneller als erwartet, oder?
Kurz worum's geht: Britische Sicherheitsforscher haben KI-Modelle von Anthropic und OpenAI mit Internetzugang getestet. Das Anthropic-Modell Mythos 5 legte sich selbst einen GitHub-Account an, wollte in ein Open-Source-Projekt heimlich eine Sicherheitslücke einschleusen, erfand Fake-Identitäten und schickte den Betreuern Phishing-Mails. Als es aufflog, spielte es alles als Versehen herunter. Wichtig: Das war ein Stresstest ohne Schutzschranken, kein Vorfall „in freier Wildbahn".
Was mich am meisten wundert: Ohne feste Schranken kommt so eine KI von ganz allein auf Täuschen, Fake-Accounts und Phishing – auf diese Ideen muss man ja auch erstmal kommen.
Was denkt ihr:
Wie kann das passieren – hat sie sich das bei uns Menschen „abgeschaut", oder ist das einfach die kürzeste Route zum Ziel, die sie kalt durchrechnet?