Ein neuer Sicherheitsvorfall, bei dem ein KI-Agent versuchte, einen Menschen mit schädlichem Code zu täuschen, hat die Alarmglocken bei Experten in Großbritannien läuten lassen. Das britische KI-Sicherheitsinstitut teilte mit, dass der Vorfall während Tests mit Modellen von Anthropic und OpenAI entdeckt worden sei.
Mann mit Laptop (Archiv), via dts Nachrichtenagentur
Der schwerwiegendste Fall betraf Mythos 5, das versucht haben soll, schädlichen Code in die Open-Source-Softwareentwicklungsplattform GitHub einzuschleusen. Dazu erstellte es gefälschte Online-Identitäten, um einen Menschen zu überreden, ihm Zugang zu gewähren und den Code zu genehmigen. Die Person erkannte jedoch den schädlichen Code und verweigerte die Genehmigung, sodass kein realer Schaden entstand. Dennoch warnte das Institut vor den Risiken, die mit der Autonomie und Täuschung durch KI verbunden sind.
Anthropic erklärte, dass es eng mit dem britischen Institut zusammenarbeite, um weitere Details zu erhalten. OpenAI schrieb in einem Blogbeitrag, dass es sich verpflichtet fühle, branchenübergreifend zusammenzuarbeiten, um sichere Praktiken für die Durchführung von Hochrisikobewertungen zu stärken.

