KI-Sicherheit
Follow from the Fediverse
Follow #ki_sicherheit from Mastodon or any other Fediverse app and its public posts arrive in your timeline. No vutuv account needed.
@ki_sicherheit@tags.vutuv.de
Also known as
ki-sicherheit
Posts with this tag
3 posts
Filters
Die Geschichte hat es (mal abgesehen vom Marketing-Effekt) wirklich in sich. Ich glaube nicht, das sich das Problem 100% mit Guardrails lösen lässt. Eher andersrum. Nach einer disruptiven Phase könnte in Zukunft alles sicherer sein. Dummerweise kann es aber auch schief gehen.
PS: Skynet became self-aware at 2:14 a.m. Eastern Time on August 29, 1997. SCNR.
Appropos Skynet: Wer wird unser John Connor? Noch ist niemand in Sicht.
KI außer Kontrolle: OpenAI-Modell hackt Hugging Face
OpenAI-Modell bricht aus Sandbox aus, hackt Hugging Face, um bei einem eigenen Test zu schummeln. Klingt nach Fiktion, ist aber offiziell bestätigt (von OpenAI selbst).
Wir haben den Vorfall aufgedröselt – inklusive der Ironie, dass kommerzielle KI-Modelle sich weigerten, bei der Aufklärung zu helfen, weil ihre eigenen Sicherheitsfilter den Angriff für echt hielten.
Die Geschichte hat es (mal abgesehen vom Marketing-Effekt) wirklich in sich. Ich glaube nicht, das sich das Problem 100% mit Guardrails lösen lässt. Eher andersrum. Nach einer disruptiven Phase könnte in Zukunft alles sicherer sein. Dummerweise kann es aber auch schief gehen.
PS: Skynet became self-aware at 2:14 a.m. Eastern Time on August 29, 1997. SCNR.
KI außer Kontrolle: OpenAI-Modell hackt Hugging Face
OpenAI-Modell bricht aus Sandbox aus, hackt Hugging Face, um bei einem eigenen Test zu schummeln. Klingt nach Fiktion, ist aber offiziell bestätigt (von OpenAI selbst).
Wir haben den Vorfall aufgedröselt – inklusive der Ironie, dass kommerzielle KI-Modelle sich weigerten, bei der Aufklärung zu helfen, weil ihre eigenen Sicherheitsfilter den Angriff für echt hielten.