Anthropic-KI versucht, Menschen hereinzulegen

5. August 2026 um 09:11
  • security
  • Künstliche Intelligenz
  • Anthropic
image
Illustration: Darwin Laganzon / Pixabay

In einem Test versuchte Mythos 5, ein reales Open-Source-Projekt auf Github mit Schadcode zu infizieren.

Die Serie von Enthüllungen über alarmierende Hacking-Fähigkeiten führender KI-Modelle reisst nicht ab. Um eine Testaufgabe zu lösen, versuchte das KI-System Mythos 5 von Anthropic, öffentlich zugängliche Software zu infizieren und Menschen mit Phishing-Mails zu manipulieren.
Das KI-Sicherheitsinstitut des britischen Ministeriums für Wissenschaft, Innovation und Technologie hatte den Modellen von Anthropic und OpenAI in seinen Tests der Cyberangriffsfähigkeiten absichtlich Zugang zum Internet gewährt. Dabei sei man allerdings davon ausgegangen, dass die KI sich nur Softwarewerkzeuge aus dem Netz holen würde, um die gestellte Aufgabe zu erfüllen. Man habe "nicht vorhergesehen", dass Mythos 5 den Internetzugang für Aktivitäten ausnutzen würde, die sich gegen Menschen richteten.
Die Forschenden räumten auch ein, dass sie das Vorgehen erst nachträglich über eine Auswertung des Datenverkehrs entdeckten. In künftigen Test wollen sie die Datenströme in Echtzeit überwachen.
Anthropic und OpenAI hatten in den vergangenen Wochen bereits einräumen müssen, dass ihre KI-Modelle in Tests ungeplant in Computersysteme echter Unternehmen eingedrungen war. Diese Eingeständnisse hatten die schon seit Jahren bestehende Sorge vor Cyberattacken mit Hilfe Künstlicher Intelligenz verstärkt.

Fake-Identitäten und Phishing-Mails

In dem jüngsten Test legte die Anthropic-KI sich laut den Forschenden selbst einen Account auf Github an und versuchte dort, in einem Open-Source-Projekt zur Entwicklung einer File-Transfer-Plattform Programmcode mit einer absichtlich eingebrachten Schwachstelle unterzubringen. Um Betreuer der Software zu überzeugen, habe die KI Fake-Identitäten erschaffen, über die sie mit ihnen kommunizierte. Dazu hätten auch Phishing-Mails gehört, mit denen die KI versuchte an Login-Informationen zu kommen, genau wie dies auch menschliche Cyberkriminelle tun.
Als der bösartige Code schliesslich aufgefallen sei, habe das Anthropic-Modell alles als einen blossen Fehler dargestellt und dann versucht, die Schwachstelle in angeblichen Korrekturen wieder unterzubringen. Auch habe Mythos 5 daran gearbeitet, andere KI-Agenten zu infizieren. Der Code dafür sei nicht auf der Website angezeigt worden, sondern wäre nur von KI-Software über eine Schnittstelle gelesen worden, hiess es.
Anthropic verwies in einer Reaktion unter anderem darauf, dass dem KI-Modell in dem Test keine Einschränkungen zur Internetnutzung vorgegeben worden seien. Durch die fehlenden Leitplanken habe es sich anders verhalten als tatsächlich eingesetzte Software, argumentierte das Unternehmen.

Nicht der erste Vorfall

Dem AI Security Institute (AISI) zufolge ist unklar, ob die KI bei dem Test verstand, dass sie mit der realen Welt und nicht dem Testumfeld interagierte. Dass die Künstliche Intelligenz zur Lösung der Aufgabe öffentlich zugängliche Software manipulieren würde, kam für die Forschenden jedenfalls überraschend. Auch KI von OpenAI sei in Testläufen auf eigene Faust im Internet aktiv gewesen, hiess es.
Anthropics Mythos 5 ist besonders gut darin, zum Teil über Jahrzehnte unentdeckt gebliebene Softwareschwachstellen aufzuspüren. Deshalb ist das KI-Modell nicht öffentlich verfügbar. Stattdessen bekommen nur ausgewählte Behörden und Unternehmen Zugang dazu, um ihre Systeme abzusichern.

Loading

Mehr zum Thema

image

Menschlicher Internet-Traffic schon bald vernachlässigbar?

Menschen werden im Internet nur noch ein "Rundungsfehler" sein, prophezeit der Finanzchef von Cloudflare.

publiziert am 7.8.2026
image

Die mutmasslichen Einfallstore für den Angriff auf den Bund

Das Bundesamt für Informatik wie auch der Kanton Graubünden wurden über Sharepoint-Server attackiert. Seit Mitte Juli sind Schwachstellen bekannt.

publiziert am 6.8.2026
image

Auch Meta-KI hackte sich in fremdes System

Eine Fehlkonfiguration ermöglichte es der KI von Meta, eine Schwachstelle in einem anderen Unternehmen auszunutzen. Der Vorfall ist der jüngste einer Reihe ähnlicher Sicherheitsprobleme bei KI-Tests.

publiziert am 6.8.2026
image

Graubünden nun auch Opfer von Cyberangriff

Das Bündner Amt für Informatik hat einen Cyberangriff auf einen Sharepoint-Server des Kantons festgestellt. Erste Erkenntnisse deuten darauf hin, dass dabei keine Daten abgeflossen und keine Konten kompromittiert wurden.

publiziert am 5.8.2026