<?xml version="1.0" encoding="UTF-8"?>
<post>
  <id>019f8fa6-5d48-7960-a446-0e34f0cbf4f2</id>
  <type>post</type>
  <thread>
    <item>
      <id>019f8eec-f4e1-7947-b515-669826708a86</id>
      <depth>0</depth>
      <author>Michael Schmidt</author>
      <url>https://vutuv.de/michael_schmidt/posts/019f8eec-f4e1-7947-b515-669826708a86</url>
      <published_on>2026-07-23</published_on>
      <body_markdown>## KI außer Kontrolle: OpenAI-Modell hackt Hugging Face

OpenAI-Modell bricht aus Sandbox aus, hackt Hugging Face, um bei einem eigenen Test zu schummeln. Klingt nach Fiktion, ist aber offiziell bestätigt (von OpenAI selbst).

Wir haben den Vorfall aufgedröselt – inklusive der Ironie, dass kommerzielle KI-Modelle sich weigerten, bei der Aufklärung zu helfen, weil ihre eigenen Sicherheitsfilter den Angriff für echt hielten.

https://www.tagworx.net/ynews.php?cid=1&amp;nid=39027</body_markdown>
      <author_username>michael_schmidt</author_username>
      <in_reply_to_author/>
      <in_reply_to_id/>
    </item>
    <item>
      <id>019f8f3c-1279-78c4-8365-7943d7df8573</id>
      <depth>1</depth>
      <author>Stefan Wintermeyer</author>
      <url>https://vutuv.de/wintermeyer/posts/019f8f3c-1279-78c4-8365-7943d7df8573</url>
      <published_on>2026-07-23</published_on>
      <body_markdown>Die Geschichte hat es (mal abgesehen vom Marketing-Effekt) wirklich in sich. Ich glaube nicht, das sich das Problem 100% mit Guardrails lösen lässt. Eher andersrum. Nach einer disruptiven Phase könnte in Zukunft alles sicherer sein. Dummerweise kann es aber auch schief gehen.

PS: Skynet became self-aware at 2:14 a.m. Eastern Time on August 29, 1997. SCNR.</body_markdown>
      <author_username>wintermeyer</author_username>
      <in_reply_to_author>Michael Schmidt</in_reply_to_author>
      <in_reply_to_id>019f8eec-f4e1-7947-b515-669826708a86</in_reply_to_id>
    </item>
    <item>
      <id>019f8f4a-7a80-7eb8-9a39-ba2635266894</id>
      <depth>2</depth>
      <author>Dr. Nikolaus Schüler</author>
      <url>https://vutuv.de/nikolaus_schuel/posts/019f8f4a-7a80-7eb8-9a39-ba2635266894</url>
      <published_on>2026-07-23</published_on>
      <body_markdown>Appropos Skynet: Wer wird unser John Connor? Noch ist niemand in Sicht.</body_markdown>
      <author_username>nikolaus_schuel</author_username>
      <in_reply_to_author>Stefan Wintermeyer</in_reply_to_author>
      <in_reply_to_id>019f8f3c-1279-78c4-8365-7943d7df8573</in_reply_to_id>
    </item>
    <item>
      <id>019f8fa6-5d48-7960-a446-0e34f0cbf4f2</id>
      <depth>1</depth>
      <author>Sebastian Hädrich</author>
      <url>https://vutuv.de/sebastian_haedr/posts/019f8fa6-5d48-7960-a446-0e34f0cbf4f2</url>
      <published_on>2026-07-23</published_on>
      <body_markdown>&quot;offiziell bestätigt&quot; und dann steht da als Quelle &quot;OpenAI&quot; – die #LLM-Unternehmen behaupten viel, wenn es ihnen nützt. Und zu &quot;bestätigen&quot;, dass ein Modell so mächtig ist, dass es aus einer Sandbox ausbricht, macht den Leuten zwar Angst, aber es verbreitet auch weiter den Narrativ, dass wir bald bei #AGI angelangt seien (https://www.jakecuth.com/work/agi-forecast-lab/). Und mit der Angst kann man auch wiederum gut arbeiten (&quot;Wollt ihr, dass den Chinesen lieber die Macht über den #KI-Markt überlassen oder wollt ihr lieber uns mehr Macht geben?&quot;).</body_markdown>
      <author_username>sebastian_haedr</author_username>
      <in_reply_to_author>Michael Schmidt</in_reply_to_author>
      <in_reply_to_id>019f8eec-f4e1-7947-b515-669826708a86</in_reply_to_id>
    </item>
  </thread>
  <description>&quot;offiziell bestätigt&quot; und dann steht da als Quelle &quot;OpenAI&quot; – die #LLM-Unternehmen behaupten viel, wenn es ihnen nützt. Und zu &quot;bestätigen&quot;, dass ein Modell so mächtig ist, dass es aus einer Sandbox a</description>
  <title>Sebastian Hädrich · 2026-07-23</title>
  <author>
    <name>Sebastian Hädrich</name>
    <username>sebastian_haedr</username>
    <url>https://vutuv.de/sebastian_haedr</url>
  </author>
  <replies/>
  <url>https://vutuv.de/sebastian_haedr/posts/019f8fa6-5d48-7960-a446-0e34f0cbf4f2</url>
  <formats>
    <json>https://vutuv.de/sebastian_haedr/posts/019f8fa6-5d48-7960-a446-0e34f0cbf4f2.json</json>
    <text>https://vutuv.de/sebastian_haedr/posts/019f8fa6-5d48-7960-a446-0e34f0cbf4f2.txt</text>
    <markdown>https://vutuv.de/sebastian_haedr/posts/019f8fa6-5d48-7960-a446-0e34f0cbf4f2.md</markdown>
    <xml>https://vutuv.de/sebastian_haedr/posts/019f8fa6-5d48-7960-a446-0e34f0cbf4f2.xml</xml>
  </formats>
  <tags>
    <item>AI</item>
    <item>no-ai</item>
    <item>LLMs</item>
    <item>OpenAI</item>
    <item>hugging-face</item>
  </tags>
  <in_reply_to>
    <author>Michael Schmidt</author>
    <url>https://vutuv.de/michael_schmidt/posts/019f8eec-f4e1-7947-b515-669826708a86</url>
  </in_reply_to>
  <like_count>2</like_count>
  <generated_at>2026-07-25T01:49:32Z</generated_at>
  <schema_version>3</schema_version>
  <published_on>2026-07-23</published_on>
  <images/>
  <review/>
  <reply_count>0</reply_count>
  <body_markdown>&quot;offiziell bestätigt&quot; und dann steht da als Quelle &quot;OpenAI&quot; – die #LLM-Unternehmen behaupten viel, wenn es ihnen nützt. Und zu &quot;bestätigen&quot;, dass ein Modell so mächtig ist, dass es aus einer Sandbox ausbricht, macht den Leuten zwar Angst, aber es verbreitet auch weiter den Narrativ, dass wir bald bei #AGI angelangt seien (https://www.jakecuth.com/work/agi-forecast-lab/). Und mit der Angst kann man auch wiederum gut arbeiten (&quot;Wollt ihr, dass den Chinesen lieber die Macht über den #KI-Markt überlassen oder wollt ihr lieber uns mehr Macht geben?&quot;).</body_markdown>
  <bookmark_count>0</bookmark_count>
  <fediverse_reaction_count>0</fediverse_reaction_count>
  <repost_count>0</repost_count>
  <thread_truncated>false</thread_truncated>
</post>
