Wenn der Praktikant den Generalschlüssel hat: KI-Agenten außer Kontrolle?
Wir haben uns die Zeit genommen, den Vorfall nochmal in Ruhe auseinanderzunehmen: OpenAI lässt seine Modelle in einem Hacking-Benchmark antreten, sicher verwahrt in einer Sandbox. Doch die Agenten finden eine Zero-Day-Lücke, brechen aus, kapern eine fremde Sandbox als Startrampe und dringen bei Hugging Face ein. Fünf Tage lang.
Wir rekonstruieren, was zwischen dem 9. und 13. Juli passiert ist und warum OpenAI erst über eine Woche später gemerkt hat, dass die eigenen Modelle dahinterstecken. Und dann nehmen wir uns das Drumherum vor: das Marketing, das aus einem peinlichen Sicherheitsvorfall mächtige, gefährliche KI macht. Die Sprache, die aus Statistik plötzlich Wollen...