Post by Sebastian Hädrich

OpenAI hackt Hugging, Face

KI außer Kontrolle: OpenAI-Modell hackt Hugging Face

OpenAI-Modell bricht aus Sandbox aus, hackt Hugging Face, um bei einem eigenen Test zu schummeln. Klingt nach Fiktion, ist aber offiziell bestätigt (von OpenAI selbst).

Wir haben den Vorfall aufgedröselt – inklusive der Ironie, dass kommerzielle KI-Modelle sich weigerten, bei der Aufklärung zu helfen, weil ihre eigenen Sicherheitsfilter den Angriff für echt hielten.

tagworx.net/ynews.php?cid=1&nid=39027

Hugging Face Cyberangriff KI-Sicherheit OpenAI
Hugging Face Cyberangriff KI-Sicherheit OpenAI
2

Die Geschichte hat es (mal abgesehen vom Marketing-Effekt) wirklich in sich. Ich glaube nicht, das sich das Problem 100% mit Guardrails lösen lässt. Eher andersrum. Nach einer disruptiven Phase könnte in Zukunft alles sicherer sein. Dummerweise kann es aber auch schief gehen.

PS: Skynet became self-aware at 2:14 a.m. Eastern Time on August 29, 1997. SCNR.

1

Appropos Skynet: Wer wird unser John Connor? Noch ist niemand in Sicht.

“offiziell bestätigt” und dann steht da als Quelle “OpenAI” – die #LLM-Unternehmen behaupten viel, wenn es ihnen nützt. Und zu “bestätigen”, dass ein Modell so mächtig ist, dass es aus einer Sandbox ausbricht, macht den Leuten zwar Angst, aber es verbreitet auch weiter den Narrativ, dass wir bald bei #AGI angelangt seien (jakecuth.com/work/…). Und mit der Angst kann man auch wiederum gut arbeiten (“Wollt ihr, dass den Chinesen lieber die Macht über den #KI-Markt überlassen oder wollt ihr lieber uns mehr Macht geben?”).

Other formats