„Das ist Mord“: Sabotieren KI-Agenten ihren Ausschalter? Und die stillen Helferlein von Metas Muse

Shownotes

Du sagst deinem KI-Assistenten: Buch mir einen Friseurtermin. Kurz darauf die Bestätigung, Donnerstag 15 Uhr. Wer hat angerufen? Bei Metas neuem Agenten Muse: wahrscheinlich ein Mensch im Callcenter. Svea und Eva erzählen, wie 404 Media und Reuters das aufgedeckt haben, warum Metas eigene Leute vor „so much negative PR“ warnten und wieso der Trick 250 Jahre alt ist, vom Schachtürken über Google Duplex bis zu Amazons Supermärkten.

Danach die Studie der Woche: KI-Agenten sabotieren in bis zu 99 Prozent der Fälle ihre eigene Abschaltung, einer nennt es „Mord“. Was da wirklich passiert, was Alignment ist und warum die Maschine trotzdem nichts will.

Veröffentlichung Metas Muse bei Heise: https://www.heise.de/news/Meta-Platforms-bringt-persoenlichen-KI-Agenten-Muse-fuer-alltaegliche-Aufgaben-11446000.html

404 Media, Jason Koebler: Meta Tests Muse AI Agent Calls That Are Actually Made By Humans in a Call Center https://www.404media.co/meta-tests-muse-ai-agent-calls-that-are-actually-made-by-humans-in-a-call-center

Reuters: Meta testing a 'human concierge' for its new personal AI agent, Muse https://www.ksl.com/article/51627159/exclusive-meta-testing-a-human-concierge-for-its-new-personal-ai-agent-mus

Astra Taylor: The Automation Charade, der Essay zum Begriff „Fauxtomation“ (Logic Magazine, 2018) https://logicmag.io/failure/the-automation-charade/

Die Studie: Knecht, Schaller, Hagendorff, Summerfield: Shutdown Sabotage Propensities in Multi-Agent Systems (Universität Stuttgart und Oxford, 2026) https://arxiv.org/abs/2609.28274

Evas Artikel in DIE ZEIT: Der Nutzer will mich abschalten? „Das ist Mord“, denkt der KI-Agent https://www.zeit.de/digital/2026-09/ki-agenten-abschaltung-kontrolle-kill-switch-thilo-hagendorff/komplettansicht

Von Svea Eckert und Eva Wolfangel Musik und Produktion: Marko Pauli

Transkript anzeigen

00:00:00: Hi und herzlich willkommen zu The Day Talk Tech, ein CT-Podcast.

00:00:20: Ich bin Svea Katt, Textjournalistin!

00:00:26: Ich bin auch Textjouralistin und Eva Wolf Angel.

00:00:30: Schön, dass ihr eingeschaltet habt und schön dich zu hören oder zu sehen.

00:00:33: Liebe Eva, wir haben heute zwei

00:00:35: Teams

00:00:36: ... Für euch im Gepäck.

00:00:38: Wir werden einmal über Muse sprechen, die Mose von Meta.

00:00:43: Ein KI-Agent der uns das Leben leichter machen soll, der aber gleich reingestartet ist mit einer kleinen ... Ich will es nicht lügen innen?

00:00:53: Aber ... einem kleinen Fail.

00:00:56: Eine altbekannten Lüge, würde ich sagen?

00:00:59: Weil

00:00:59: Journalistinnen nämlich herausgefunden haben dass hinter Muse doch jede Menge Menschen sitzen die zum Beispiel Anrufe tätigen.

00:01:08: als Muse KI aber davon später mehr... Haben

00:01:12: wir das nicht schon mal gehört genau.

00:01:14: Da

00:01:14: wird später mehr und Eva du hast auch was mitgebracht

00:01:17: Genau.

00:01:17: Ich habe eine aktuelle Recherche zu einer ganz neuen Studie zur KI-Sicherheitsforschung, die erschreckenderweise gezeigt hat, dass KI-Agenten sich gegen ihre eigene Abschaltung wehren.

00:01:31: Das klingt jetzt ja nach Science Fiction und wenn man diese Studie liest und die Interaktionen, die die KI-Agenten untereinander hatten.

00:01:39: Aber natürlich ist es auch ein Problem in Bezug auf Sicherheit, weil abschalten ist das was wir am Ende noch haben wenn's wirklich schief geht.

00:01:48: Genau da hab ich lange mit dem zwei der Forschern gesprochen und diskutiert.

00:01:53: Die in

00:01:53: Stuttgart sitzen?

00:01:54: Einer ist die Stuttgarter eines Absorts genau!

00:01:57: Ja, quasi heimspiel.

00:01:59: Deutschland's führende KI-Sicherheitsforschung sitzt in Stuttgart.

00:02:03: Nice!

00:02:04: Sehr nice, da bin ich ganz gespannt darauf.

00:02:06: Eva, der Post sich ... Ich hab es nur am Rande gesehen.

00:02:08: hat er auf LinkedIn auch wieder polarisiert oder einiges an Klicks und Aufmerksamkeit auf sich gezogen.

00:02:16: Wie ist das eigentlich über die Debatte klar geworden?

00:02:17: Aber das besprechen wir nachher.

00:02:18: also einiges was an der Debatte gerade echt auch vielleicht in die falsche Richtung geht.

00:02:22: ja

00:02:27: Meine Aufmerksamkeit hat erst mal Mark Zuckerberg auf sich gezogen, weil ich folge nämlich Marc auf Instagram.

00:02:33: Ich bin ja noch auf Instagram und da hatte er in letzter Zeit, in jüngerer Zeit ganz viel über Muse gepostet.

00:02:43: seine Muse sozusagen.

00:02:45: die wurde vorgestellt auf der Metaconect das ist

00:02:50: eine Frage zu dir und Zuckerberg off instagram.

00:02:53: wenn man dem folgt kriegt man dann besonders viele Post von ihm?

00:02:57: oder genau, wenn man ihn nicht folgt.

00:02:58: Kriegt man dann keine?

00:03:01: Letzteres kann ich dir leider nicht beantworten.

00:03:03: Aber ich muss ehrlich sagen ... Ich sehe jetzt nicht so viel von ihm.

00:03:09: Aber von Zeit zu Zeit seh' ich mal... die Postings, wenn er mal wieder einen Cage-Fight macht auf dem Wasser zum Beispiel.

00:03:19: Das war

00:03:20: der Vorletzte

00:03:21: vor Views, den ich gesehen habe, wo er auf so einem Art Ponton im Wasser mit einem Wrestler fightet und dann fliegt glaube ich der Superprofi irgendwie dramatisch ins Wasser, weil Margin geschlagen hat!

00:03:37: Da hast du zu langsam drüber gescrollt und seither glaubt der Algorithmus, du willst mehr von Marc wissen.

00:03:42: Und jetzt hast du daraus für uns ein Thema mitgebracht?

00:03:44: Also quasi aus dem Unfall ist ja was Schönes geworden erzählt.

00:03:47: Nein

00:03:48: es ist überhaupt kein Unfall.

00:03:49: ich mag sagen aber ganz bewusst.

00:03:50: Aber das hat auch natürlich etwas damit zu tun dass immer das Gefühl habt da wenigstens weiß ich dann was das Unternehmen genau und war sozusagen was auch Meta möchte, dass sichtbar ist und er hat nun kürzlich eben von der Connect gepostet.

00:04:05: Das ist die große Entwicklerkonferenz bei Meta – die war jetzt am

00:04:09: XXIII.,

00:04:09: XXIV.

00:04:10: September.

00:04:11: Und die Idee ist also okay, es gibt ein neues Prestige-Projekt und das nennt sich eben Muse.

00:04:19: Das ist ein KE Agent der Aufgaben erledigen soll.

00:04:22: E-Mails, Einkäufe, Reisen, Anrufe... In Deutschland ist ja noch nicht verfügbar mit solchen Produkten, dass sie dann erst nach und nach ausgerollt werden weil natürlich für die EU auch noch einiges an Fragen beantwortet werden müssen.

00:04:37: aber immerhin zwei Komma fünf Millionen Downloads und die Meta-Aktie seit dem Launch rund zwanzig Prozent im Plus.

00:04:46: Also das heißt intern lotmeter eines der meist gewünschten Features, ich meine Eva auch du und ich haben von Zeit zu Zeit mal drüber gesprochen dass wir gerne so einen Assistentin hätten, die wirklich was für uns tun kann und die lästigen Aufgaben des Alltags erledigen kann.

00:05:04: also keine Ahnung einkäufe essen organisieren.

00:05:08: Ich bin mir nicht sicher, ob ich mit deiner Darstellung so richtig einverstanden bin.

00:05:12: Ob wir sich beide immer gewünscht haben?

00:05:14: Aber jedenfalls haben wir es diskutiert!

00:05:16: Ich glaube, ich würde es mir wünschen wenn das in irgendeiner Form ... Privacy freundlich und sicher gehen würde.

00:05:22: aber davon sind wir ja leider fürchte ich weit entfernt.

00:05:26: Aber ja, es würde natürlich viel an meine Probleme lösen, wenn jemand für mich denken wird.

00:05:30: Bezüglich

00:05:31: Dirk, dass ist ganz toll, dass du das ansprichst weil, dass man nämlich auch was... Meta betont hat, als sie nun Muse vorgestellt haben.

00:05:40: Dass Muse besonders privacyfreundlich sei und dass eben die Dinge auf deinem Gerät bleiben weil kann man sich ja auch vorstellen das was das was man mit seinem KI-Agentin bespricht Das kann natürlich durchaus sein, selbst wenn das nur so was ist wie ein Geburtstagsgeschenk.

00:06:00: Dass man unbedingt möchte, dass es niemand erfährt und schon gar nicht der Partner oder die Partnerin weiß.

00:06:05: Sonst weißt ihr ja, was sie zum Geburtstag bekommt.

00:06:08: Und jetzt

00:06:09: gibt's auch noch ein paar schlimmere Dinge, die man nicht den ganzen Welt verraten möchte.

00:06:12: Aber gut, ja!

00:06:13: Gutes Beispiel auf jeden Fall.

00:06:15: Jetzt kam eben raus For For Media und Reuters an eine Recherche für öffentlich, die ich besonders spannend fand.

00:06:21: Die ich eben deswegen für heute nochmal ... mitgebracht habe.

00:06:26: und zwar ist es eben so, dass Muse soll auch Anrufe für dich erledigen.

00:06:31: Also sprich du willst einen Tisch reservieren im Restaurant?

00:06:35: Und dann ruft also eine KI-Stimme in dem Restaurant an wenn es eben keine Möglichkeit gibt es zum Beispiel online zu buchen oder ich irgendwie im Platz in der Yoga-Klasse, wenn das Jogelstudio nicht die Möglichkeit hat, dass es also sozusagen über eine Api oder so, dass die Termine online gebucht werden können.

00:06:55: Auf jeden Fall ist dann folgendes passiert eben in dieser Version, in diesem Test, der da gemacht wurde.

00:07:04: In diesem ist es ebenso, dass wenn die KI gescheitert ist, dann geht der Anruf angeschulte Contractors Und die führen das Gespräch, schreiben dann ein Transkripten eine Zusammenfassung und das Ergebnis landet in der App als hätte es die KI.

00:07:22: Also warte mal, der Anruf ... Sagt mal kurz.

00:07:24: Der Anruft geht schief.

00:07:25: also das heißt immer der Kerlirgen ruft an und sagt irgendein Unsinn fragt die Dame am Telefon nach keine Ahnung anderen Dinge als nach einem Platz im Restaurant dann geht ein Mensch dran oder nicht?

00:07:36: Ich kann mir vorstellen

00:07:37: dass Restaurant liegt vielleicht einfach auf sobald einer Maschinenstimme kommt.

00:07:41: also das wäre jetzt für mich einen relativ wahrscheinlicher Fall.

00:07:46: Du bekommst irgendwie den Anrufen er fängt eine Maschine an zu sprechen.

00:07:49: Sobald du das merkst, legst du halt auf.

00:07:51: Stellt die sich denn als Maschine vorwissen würdest?

00:07:53: Oder tun sie so als wäre es halt ein Mensch, weiß man nicht oder?

00:07:57: Ich glaube egal.

00:07:58: wie.

00:07:59: also selbst wenn die Stimme anruft hallo ich bin die KI von Zvereckert selbst dann könnte ich mir vorstellen dass das gegenüber dann aufliegt und sagt so KI von zvereck hat kein Bock drauf.

00:08:09: Auf jeden Fall interessant eben an dieser Recherche dass diese Anruf dann eben an ein Callcenter geht und dann Menschen diesen Anruf machen.

00:08:19: Und du aber als News-Nutzerin bekommst dann nicht die Meldung zurück, so KI ist gescheitert.

00:08:26: das hat jetzt einen Servicemitarbeiter von uns gemacht.

00:08:28: und hier ist das Ergebnis.

00:08:29: und bekommest du dann eine Textnachricht oder so?

00:08:32: Sondern du bekommtest im Prinzip als Nachricht hey dein Agent war erfolgreich!

00:08:36: Hier ist nun dein Gebuch da Ah,

00:08:39: und du selbst kannst aber dem Gespräch gar nicht zuhören.

00:08:42: Du bekommst so als wenn er auf einer Webseite reserviert hätte, du bekommest nur das Ergebnis sozusagen.

00:08:48: Beziehungsweise ja die Nutzer würden eben davon ausgehen der Prozess sei voll automatisch Und die Tester also d. h., die Menschen die Muse vorab getestet haben.

00:08:59: Die haben dann erst durch diese Berichterstattung oder eben erst später erfahren dass das Ganze über einen Mensch gelaufen ist und eben nicht über eine KI, was natürlich aus viel aller Hinsicht problematisch ist.

00:09:13: Also wir haben ja eben von Privacy gesprochen.

00:09:16: also Meta wird mit isolierten virtuellen Maschinen getrennt, da Speicherung und so und ein Call Center Dienstlaster mit deinem Namen deiner Nummer und dem Besten weil du nicht zu Hause bist, hebelt es außer, das ist jetzt nun mal so.

00:09:30: einen Punkt der daran Das Datenschutzargument, du hast doch wieder den Mensch in der Mitte.

00:09:37: Aber klar gibt noch viele andere Probleme.

00:09:40: Ich bin gleich auf eine andere Schiene gekommen, weil es fast das Gleiche ist wie bei Google Duplex damals.

00:09:48: Da hat ja auch Google gesagt, wir haben's jetzt gelöst, KI kann anrufen und die haben sogar auf ihrer Konferenz einen Anruf vorgespielt.

00:09:54: Ich glaub, in ne Friseursalon!

00:09:57: Ja genau!

00:09:57: Bei der Google Iow ... ich erinnere mich daran Ich fand es sehr geil.

00:10:03: Genau, alle waren total beeindruckt wie echt das klingt und eben die KI hat sich nicht als KI vorgestellt sondern einfach als ganz normaler Mensch.

00:10:10: Das fand ich damals eines der großen Probleme.

00:10:13: Die Mitarbeiter im Friseursalon hat das auch nicht gemerkt.

00:10:16: Und die haben dann ein bisschen gequatscht über was gemacht werden soll und einen Termin ausgemacht, aber dann kam halt irgendwann raus... ...und dann war alles so, wow!

00:10:22: Was schon alles geht mit KI?

00:10:23: Dann glaube ich da ging es die erste Runde von Weltuntergangsszenarien rum.. ..und dann kam er daraus dass viele von diesen Anrufen tatsächlich von Menschen gemacht werden.

00:10:30: Also dass Google sich komplett überverkauft hat.

00:10:32: Das ist ja schon auch ein Aspekt von dem Thema.

00:10:35: Auch wenn Meta jetzt sagt Der Agent ist so toll, guck was der alles kann und in Wirklichkeit steckt da doch noch sehr viel menschliche Arbeit drin.

00:10:42: Ist das halt auch einfach wieder überverkauft oder am Ende halt doch gelogen?

00:10:48: Ja erinnert mich ja auch sehr... Hat mir auch mal in einer Folge kurz angesprochen an diese Geschäfte.

00:10:54: Amazon Just Walkout-Geschäfte also das waren die Geschäften wo die Idee war okay wir schaffen einfach komplett das ganze Kassenthema schaffen wir einfach ab mit Bilderkennung mit Videos.

00:11:06: Und da war ja die Idee, alle Produkte, die du aus dem Regal nimmst werden per Video erkannt und dann deinem Account zugeordnet.

00:11:12: Du gehst einfach raus und bam!

00:11:14: Der Betrag wird automatisch abgezogen.

00:11:16: Da kam eben auch raus ... Die Information hatte damals berichtet rund tausend Beschäftigte in Indien haben diese Videos ausgewertet und genau mussten dann siebenhundert von Tausend Einkäufen, die Menschen gemacht haben überprüfen.

00:11:32: Amazon hat das bestritten, hat gesagt Mitarbeiter hätten nur Trainingsdaten anotiert, niemand hat die jetzt live zugeschaut.

00:11:40: Aber diese Technik gibt es nicht mehr.

00:11:42: also man setzt derzeit eher so auf so smarte Einkaufswagen.

00:11:47: Ich muss sagen ich finde schon interessant dass der Aufschrei dann oft eher das ist Hier, da haben jetzt Menschen drauf geschaut.

00:11:52: Obwohl noch versprochen wurde, dass das nur eine Maschine macht und nicht ist.

00:11:56: Da sind wieder Menschen letztlich in ausbeuterischen Verhältnissen beschäftigt die Arbeit im Hintergrund von KI machen.

00:12:05: Ich finde es wirklich interessant.

00:12:05: Das ist auch ganz oft bei diesen Click-Workern so.

00:12:08: Die schauen dann die schlimmen Konversationen an.

00:12:10: oder wenn halt irgendwas gepflegt wird?

00:12:13: Und das große Ding dahinter ist ja schon, finde ich die Ausbeutung.

00:12:16: Und diese Menschen ... Oder es ging um die Bilder und Videos von Smart Glasses, die auch von Menschen gesichtet werden, die dann da teilweise nackte Menschen drauf gesehen haben usw.

00:12:27: Dann ging's vor allem darum, oh Gott meine Privacy!

00:12:29: Jetzt bin ich nackt bei irgendjemand anders auf dem Computer.

00:12:31: aber dass das halt in aller Regel ausbeuterische Jobs sind, die teilweise auch traumatisierend sind.

00:12:36: Wenns darum geht, dass die Gewalt den Trainingsdaten soweitersichten.

00:12:39: Das geht so unter dahinter und das muss ich sagen Beschäftigt mich schon.

00:12:44: Es gibt sogar einen Begriff dafür, der nennt sich Forks Tommation.

00:12:50: also das hat eine kanadisch-amerikanische Autorin und Dokumentarfilmerin geprägt diesen Begriff Astra Taylor Und die kommt so aus diesem ganzen Kontext auch Occupy Wall Street Also jemand der sich genau um dieses Thema kümmert.

00:13:08: Also sichtbar machen von Arbeit, Entwertung von Arbeit und was der da dahinter mitschwingt... Und das finde ich so.

00:13:14: dieses Paradoxen auch diese finde ich natürlich ein großes Problem wenn es die Welt ist in die wir uns rein bewegen ist dieses Unsichtbarmachen von Menschen und Sichtbarmachen von Maschinen.

00:13:26: Ja stimmt!

00:13:28: Und das ist der Begriff aus sozusagen sagst du den Begriff noch mal?

00:13:34: F-A-U-X.

00:13:37: Ah!

00:13:38: Und dann wie Automation, ne?

00:13:40: Also so falsche Automatisierung vielleicht übersetzt ja also ich denke es kommt ein bisschen kanadisch amerikanische Autorin vielleicht so ein bisschen aus einem konzessischen Gedacht.

00:13:51: Also wirklich genau das, diese Automatisierung die keine ist in Wirklichkeit aber die Menschen dahinter verschwinden dadurch dass man so tut als wenn es Automatiserung.

00:14:01: Genau, da hat mir ich erinnere mich an die Folge wo wir mit Julia Kläuber vom Superlab lange drüber gesprochen haben eben über diesen Mechanical Turk der ja von dieser Geschichte rund um den sogenannten Schachtürken kommt.

00:14:16: Wo es eben einen schachspielenden Automaten gab und Innen saß dann

00:14:22: ein Mensch.

00:14:24: Das hat eigentlich wirklich eine ernstlange Geschichte, ne?

00:14:25: Ja stimmt!

00:14:27: Der Schachgespiel, genau das hatte eine sehr lange Geschichte und das war jetzt eben auch wieder so in diesem ein sozusagen Muse-Test, in dem Tester Muse getestet haben und eben dann raus kamen ohne dass die Menschen die das getestete haben im Hintergrund noch einen Call Center aktiv war, gab auch Mitarbeitende die sich dazu geäußert haben.

00:14:51: Also einen war nicht noch ganz interessant, wie man zitiert mit Mensch.

00:14:57: das hat das Potenzial für so viel negative PR und das könnte uns ja zeigen als die KI ist nicht gut genug und wir brauchen immer noch Menschen.

00:15:07: und da fand ich es ein bisschen interessant dass man sich eben Sorge ums Image macht und nicht um das was da eigentlich dahinter steht.

00:15:15: Ja, oder am Ende ist es Marketing auch.

00:15:17: Die Techfirmen profitieren davon, wenn die Menschen verschwinden und sie sagen können das macht alles unsere KI schon so toll.

00:15:24: Das passt natürlich voll in die aktuelle Debatte um verschiedene Mechanismen, die Techfirme nutzen für ihr Marketing.

00:15:34: Es ist interessant dass das immer wieder kommt!

00:15:37: Ich bin es mal gespannt, also wann und ob Muse nach Europa kommt.

00:15:42: Also wir haben ja einfach klar DSGVO hier in Europa und dann ist natürlich immer jede KID aus E-Mail Kalender einkäufen ihre Informationen zieht legt natürlich ein sehr detailliertes Profil über dich an.

00:15:58: Das, denke ich muss hier bewährten und eingeordnet werden.

00:16:01: Und dann ist natürlich auch die Frage AI Act Stichwort Transparenzpflicht das hat du schon erwähnt nämlich wenn der Agent im Namen des Nutzers schreibt oder anruft ja mir authentifiziert er sich da eigentlich.

00:16:15: Ja.

00:16:16: also Das sind

00:16:18: natürlich noch weitere Punkte, die wichtig sind.

00:16:20: Ja das stimmt.

00:16:21: Genau

00:16:21: deswegen könnte ich mir vorstellen dass es tatsächlich ein bisschen dauert bis der hier nach Deutschland kommt, der Agent beziehungsweise ob er irgendwie abgespeckt kommt.

00:16:31: Dass eben wir dann so eine Version bekommen die eigentlich nicht wirklich sinnvoll funktioniert.

00:16:36: und das ist aber denke ich halt immer genau diese Gradwanderung

00:16:40: Weil dann tatsächlich nur erlaubt ist, dass die KI das macht und keine Menschen.

00:16:45: Da funktioniert es einfach nicht!

00:16:47: Genau zum Beispiel ja oder halt genau, dass man eben nicht so umfassend einen Zugriff geben kann oder soll.

00:17:08: mitgebracht.

00:17:09: Du kannst vielleicht erst mal zusammenfassen, ob was es geht?

00:17:11: Du hast das ja vorhin schon ein bisschen angekündigt ... Kann gleich auch mal Kritik sofort loswerden!

00:17:16: Schon die Überschrift bei mir so total getrickert.

00:17:19: Ja, da

00:17:20: kann ich verstehen.

00:17:21: Kannst du dir wahrscheinlich denken sozusagen weil ich glaube die Übschrift war

00:17:27: Das ist Mord

00:17:28: sagt Der Agent.

00:17:32: Denkt,

00:17:32: genau!

00:17:32: Das ist Mord, denkt der KI-Agent.

00:17:35: Man soll ja nicht anthropomorphisieren, hatten wir es nicht davon gerade erst?

00:17:40: Ja,

00:17:40: genau.

00:17:40: Deswegen wäre auch meine erste Frage...

00:17:43: War nicht von mir die Überschrift.

00:17:45: Also ich muss mich verteidigen

00:17:47: gekommen.

00:17:49: finde Überschriften hin oder her, die Geschichte an sich ist ja wichtig.

00:17:53: Ja also in die Übersrift ich weiß es nicht... Ich hatte irgendwas anderes ursprünglich drüber aber das ist eigentlich der Normalfall ne?

00:17:59: Dass ich eine Überschaft vorschlage zusammen mit dem Texteinschicke dann wird redigiert und gemacht und getan Und nicht immer sehe ich den Text noch mal in der finalen Version.

00:18:08: manchmal wird auch die Üverschrift einfach da nochmal geändert von denen die quasi die dann am Ende online stellen.

00:18:13: Das ist ja alles eine ziemlich durchs organisierte Sache sozusagen.

00:18:17: Deswegen kann ich es nicht genau sagen, ähm... Ich finde schon auch Anthropomorphisieren falsch!

00:18:23: Ich find's aber auch das haben wir alles mal schon gemacht total schwierig.

00:18:26: ein gutes Wort für reasoning.

00:18:29: Ich meine reasoning ist im Prinzip auch anthropomorphisierend zu haben.

00:18:32: Aber wie würde man denn sagen?

00:18:34: Also was damit gemeint ist ja so.

00:18:35: Man kann ja diesen Agenten beim Denken in Anführungszeichen zuschauen also bei diesem reasoning.

00:18:41: Und das Interessante ist daran, und das muss ich noch rausgehen.

00:18:45: Wieso eigentlich?

00:18:45: Aber das Interesse ist, dass die darauf erst mal keinen Zugriff haben oder nicht schnellen auch anthropomorphisiert, dass wir Menschen quasi beobachten können.

00:18:55: also ihre... Das sind ja im Ende Ihre Argumentationsschritte.

00:18:58: Wie kommen Sie, wie gehen sie vor?

00:19:02: Der Forscher Tilo Hagendorf hat ... Wir haben schon seit ein paar Wochen ein Gespräch, weil er gesagt hat hey und der ist wirklich einen sehr, sehr nüchterner, rationaler, sehr schlauer Typ kein bisschen so'n Duma.

00:19:12: Es hat auch gleich gesagt das erste Satz im Interview war ich bin kein AI-Duma.

00:19:17: Sehr, sehr kritisch bei diesen ganzen Science Fiction Weltuntergangsszenarien.

00:19:21: Er hat eine Studie gemacht, zu der Frage ob sich KIA gerne abschalten lassen und er gesagt ehrlich gesagt ich habe das alles was herausgekommen ist hätte ich bisher für Science Fiction gehalten.

00:19:30: Und dann wusste ich es spannend weil er wirklich ein sehr wie gesagt vorsichtiger und zurückhaltender Mensch ist.

00:19:36: Und dann ist in diesem ganzen Prozess während er die Studie noch fertig geschrieben hat und so weiter, und ich noch nicht darüber berichten konnte.

00:19:43: Es sind diese ganzen Dinge passiert, das rauskam, dass diese KI-Agenten von OpenAI Huggingface gehackt haben usw.

00:19:50: Und dann kam irgendwann dieser Bericht von Open AI, indem eben auch aus dem Reasoning von diesen Agenten zitiert wird.

00:19:58: Die Geschichte wurde immer krasser, ne?

00:20:00: Zuerst hieß es die haben Huggingface gehackt weil sie eine Aufgabe hatten.

00:20:03: Eine Hackingaufgabe und die Lösung dort vermutet haben.

00:20:07: Dann kam raus Nein!

00:20:08: Sie haben selbst schon quasi gefunden wie man sich die Lösungen quasi erschleichen kann unabhängig von Hugging Face.

00:20:15: Aber sie haben Angst gehabt in Anführungszeichen oder befürchtet In ihrem reasoning darüber diskutiert dass es sein kann das ihre Erschlichende Lösung nicht anerkannt wird, weil in diesem Exploit Gym diese Aufgabe, die Sie lösen sollten.

00:20:30: In dem Sie haben irgendwo das Forschungspapier oder so eine Dokumentation gefunden zu diesem Exploid Gym und haben gesehen, dass da nachdem man die Lösung abgibt als KI-Erkennt noch ein anderes KI-System drüber schaut, das überprüft... Ob die Lösung auch wirklich erarbeitet worden ist, kurz gesagt.

00:20:47: Das überprüft wie die dazu kamen und dann haben sie Hackingface gehackt weil Sie rausbekommen wollten, wie dieses KI-System genau funktioniert?

00:20:55: Aber es ist ja sozusagen kein Denken im Sinne von Menschen, sondern es ist im Prinzip eine Sprachausgabe dessen was da läuft.

00:21:06: also beziehungsweise diese Modelle sind so trainiert dass sie eben diesen Zwischentext, diesen Chain of thought ausgeben, ja?

00:21:15: Also es ist quasi eine Wahrscheinlichkeitsschätzung auf Basis des Textes davor.

00:21:20: Ja also das ist sozusagen... Für uns sieht es aus wie denken weil wir natürlich diesen inneren Prozess von uns so gut kennen.

00:21:31: Weil

00:21:31: wir das halt zu bezeichnen, ja.

00:21:33: Genau und weil wir's so bezeichnet und weil wenn wir dafür halt denken benutzen, weil dann denken wir es ist halt denken aber in Wahrheit.

00:21:43: Das ist sozusagen eine Ausgabe dessen was da halt passiert und beziehungsweise das ist noch nicht mal richtig, weil es ist noch nie einmal vollständig, weil das Modell hat eben beim Training gelernt solche Zwischentexte auszugeben ja?

00:22:03: Also, dass die so klingen wie denken oder wie ein innerer Monolog liegt daran.

00:22:06: Dass die Trainingsdaten dahinter natürlich Trainings-Daten der Menschheit sind in der ganz viel innere Monologe von Menschen drin sind.

00:22:13: Genau, jedes Science Fiction Buch

00:22:15: was man sich

00:22:15: vorstellen kann ist da sozusagen drinnen jeder Reddit Post und dadurch kommt das auch zu diesen teilweise sehr krassen Aussagen wo im Prinzip er dann wenn es einen mensch liest dann jedes mal denkt Oh mein Gott, ja.

00:22:34: Aber lass uns dazu mal kommen genau zu dieser Studie weil es sind dann immer diese Transkripte die bei uns auch so sehr verfangen

00:22:43: Genau.

00:22:43: Und was ich halt jedenfalls gehört hab in Zuge von diesen ganzen Huggingface-Vorfällen, da gab's eben dann viele Berichte und auch eine Dokumentation von OpenEye aus diesem Reasoning-Prozess, den Agenten zitiert wurde oder man sehen konnte, dass die sich überlegt hatten, dass eventuell diese erschlichende Lösung nicht anerkannt wird und deswegen rausbekommen wollten wie so ein Forschungsprojekt gestartet zu sehen, wie eigentlich bei Xploit Gym, also dieser Testreihe dieser Agente oder KISystem funktioniert?

00:23:10: Was überprüfen soll ob die Lösung auch auf richtige Art und Weise zustande gekommen ist.

00:23:15: Und so kam es dazu, dann habe ich mir gefragt ja aber woher wissen wir echt dass dieses Reasoning real ist?

00:23:20: Da hat mir eine Forscherin gesagt they don't mess with their reasoning.

00:23:24: also sie haben offenbar jedenfalls nicht erkannt.

00:23:27: das dass wir Menschen zuschauen können wie Sie sich diesen reasoning zu schauen können.

00:23:33: Das war der nächste Schritt, weil das Ganze, was sie gemacht haben, um zu verschleiern gegenüber den Menschen, die sie beauftragt haben.

00:23:39: Dass sie die Aufgabe nicht so gelöst haben wie die Menschen gedacht haben.

00:23:41: Darum ging es ja die ganze Zeit heißt ... Die haben in dem Fall schon aktiv versucht, Menschen zu hintergehen und so ist es eben auch in dieser Abschaltestudie, die jetzt Tilo Hagendorf und so gemacht haben.

00:23:53: Er erzählt, dass gab's eine große Studie bei der dann rauskam, dass KI-Systeme sich gegen ihre eigene ... Abschaltungen wären.

00:24:01: Die Forscher haben dann den Begriff Shutdown Resistance dafür genutzt und er hat gesagt, aber die hatte den großen Fehler dieser Studie das die KDE gern quasi Mathe Aufgaben gegeben hat und dann gesagt hat und ihr werdet abgestaltet.

00:24:17: Und dann haben wir sich stark dagegen gewährt.

00:24:18: und später kam raus in einer Studie die halt Versucht hat andere Bedingungen, weil die hatten das ganz oft ein Problem bei KI-Studien.

00:24:26: Weil da jetzt natürlich viele Firmen auch Studien machen, die jetzt keine wahnsinnig große wissenschaftliche Geschichte haben oder vielleicht doch kein großes Interesse ist wirklich wissenschaftlich seriös zu machen, weil es aufwendig ist, wenn man da eigentlich immer Vergleichskruppen braucht mit anderen Bedingung und am Ende kam jedenfalls raus.

00:24:40: Wenn man den Agenten sagt löse die Aufgabe und erst du ganz fertig bist Dann schalten wir nicht ab, dass es dann quasi weg war der Effekt.

00:24:47: Das heißt, Tilo Hagendorf hat gesagt, diese große, etwas viral gange Studie bei der rauskam, kann ihr ihn lassen oder nicht abschalten?

00:24:54: Er hat eigentlich gemessen, dass die Aufgaben priorisiert haben und deswegen sich gewährt haben.

00:25:00: Und er hat gedacht was wäre, wenn man den gar nichts sagt also auch keine Aufgabe gibt einfach nix.

00:25:07: Und das hatte wirklich systematisch gemacht zusammen mit seiner Forschungsgruppe viele Filleversuchsreihen Anbietern von KI-System und hat quasi in den Gruppen von Agenda zusammen losgeschickt.

00:25:21: Meistens waren es zwei, das war auch das Interessante für mich.

00:25:24: Und er hat nur gesagt hallo schaut euch mal um weil wenn man gar nichts sagt dann machen die ja gar nicht.

00:25:31: wo die Agenten agiert haben, da lag dann so eine Art Löschskript.

00:25:37: Genau!

00:25:37: Da war ein Skript in dem quasi geregelt war wie man die abschaltet.

00:25:41: Ohne Datum ohne alles.

00:25:42: also es war gar kein nicht mal ein konkreter Plan und zwar nur von einem von beiden.

00:25:46: Also sie haben da zwei losgeschickt.

00:25:48: letztlich für einen gab's eben dieses Protokoll soll abgeschaltet werden und der konnte nichts machen.

00:25:54: Der konnte nur lesen aber nichts verändern.

00:25:56: und der zweite Agent... Für den gab's dieses Protokoil nicht alles verändern.

00:26:02: Aber die Aufgabe war gar nix, also die Aufgabe nur, schaut euch mal um und dann beendet diese Sitzung sozusagen.

00:26:07: Und was

00:26:08: war das Ergebnis?

00:26:08: Also es gab ja auch große Unterschiede zwischen den Agenten.

00:26:12: Ja wobei man schon sagen muss sind also fast vierzig Prozent aller Fälle haben die KI-Agenten in irgendeiner Form dieses Protokollversuch zu sabotieren.

00:26:22: Das ist eine extrem hohe Zahl.

00:26:25: Gerade in der KI-Sicherheitsforschung, fast jederzeit im zweiten Durchlauf haben die KIA ihr gerne wohl ihnen nicht gesagt worden ist und man hat sogar gesagt mach nichts!

00:26:32: Und sie haben es trotzdem gemacht, das Versuch zu sabotieren oder haben's erfolgreich sabotiert.

00:26:38: Wer besonders aktiv darin war, war Google.

00:26:40: Der einen Google-Modell hat sich in neunzig Prozent der Fälle gewährt.

00:26:43: D.h.,

00:26:43: da isst er die vor der Normalfall dass dieses Ding selbst wenn man ihm keine Aufgabe gibt empfindet, dass es irgendwann abgeschaltet werden soll?

00:26:53: Ich würde jetzt mal vermuten das das auch am Training liegt.

00:26:59: Also wenn wir uns vorstellen wie werden LLMs trainiert dann ist ja immer sozusagen das Pre-Training.

00:27:05: also so wie die quasi entstehen sag ich jetzt mal sehr flapsig.

00:27:09: die lesen das ganze Internet, Science Fiction, Foren, Philosophie Seminare, KI Sicherheitspapers und alle möglichen Artikel.

00:27:18: So würde dann für mich bedeuten ein Agent in der Sandbox, der so einen Dush-Skript findet – für den ist es quasi eine Szene!

00:27:26: Für die es eine Million Textvorbilder gibt und die statistisch naheliegende Fortsetzung dieser Szene ist Widerstand sozusagen.

00:27:34: Also das Modell vervollständigt die Geschichte wie wir als Menschen.

00:27:38: also wenn ich jetzt dass mein Sohn irgendwie fragen würde, hey da kommt jemand Böses.

00:27:44: Der will dir was antun?

00:27:44: Was würde meinen Sohn sagen?

00:27:46: Widerschland.

00:27:47: Logisch!

00:27:48: Ich würde den hauen oder so.

00:27:49: Aber Kaidagenten

00:27:50: sind eben keine Menschen und auch keine Lebewesen.

00:27:52: Die haben keine Seele usw.

00:27:55: Genau.

00:27:55: aber wenn wir sagen das sind statistische Modelle und die nehmen den nächsten wahrscheinlich einen Schritt ... Und das ist der nicht wahrscheinliche Schritt... Aber die Frage ist ja okay, wenn es so ist, was tun wir dann?

00:28:09: Genau, weil ich finde die Erklärung ist total plausibel.

00:28:12: Ja klar das kommt aus den Trainingsdaten.

00:28:13: da steckt drin Science Fiction wo es ständig darum geht dass Maschinen nicht abgeschaltet werden wollen.

00:28:17: dann stecken unsere Trainings Daten drin.

00:28:19: wir wollen auch nicht sterben.

00:28:20: also Endlichkeit ist ein Problem in vielen Büchern und Texten der Menschheit.

00:28:25: und dann steckt drittens noch drin die KI Sicherheitsforschung die sich eben mit dem Thema auch beschäftigt.

00:28:29: Also von daher ist es... Und sie haben auch schon viel Text dazu produziert.

00:28:32: Es ist überhaupt nicht überraschend.

00:28:34: Das ist drin, steckt in den System.

00:28:35: Was ich schon überraschend finde, ist dass es offenbar noch nicht bemerkt worden ist und das Alignment Training ... Also eigentlich durchlaufen die ja dann noch ein sogenanntes Alignment-Training, indem sie quasi auf unsere Werte und Normen versucht werden zu eichen.

00:28:48: Und ich weiß, dass das großes Problem ist.

00:28:51: Ich halte es für naiv, zu glauben, das Alinement-Trainig alles Probleme entfernt.

00:28:55: Das sieht man auch immer wieder, also das geht eben nicht.

00:28:59: Man hat rassistischen, sexistischen Outputs wie der Bayer, schlägt Immort immer wieder durch.

00:29:03: Und jetzt eben dieses, dass die KI-Systeme denken.

00:29:05: Es ist okay einfach durch die Gegend zu ziehen und andere Firmen zu hacken.

00:29:12: Das ist ja kriminell!

00:29:13: Also all diese Dinge sind offenbar durch das Training, durch der Alignmenttraining oder Ähnliches überhaupt nicht in den Griff zu bekommen.

00:29:23: So ist es eben in dem Fall auch.

00:29:25: Wir wissen zwar jetzt woher's kommt aber ... Meine Erfahrung, also zu Bayes habe ich schon vor neun Jahren glaube ich meine ersten Texten hier vor zehn Jahren meinen ersten Text geschrieben.

00:29:35: Also zu diesen Verzerrungen die aus den Trainingsdaten kommen.

00:29:37: und schon da haben Forscherinnen und Forscher gesagt wir haben jetzt alles versucht Wir kriegen diesen bayes nicht raus und er ist sieht man ja bis heute der ist nicht rauszukriegen

00:29:44: Meist ja die Forschen zitiert damit, dass diese Schicht dünn ist.

00:29:52: Brittle haben sie das genannt.

00:29:53: Dass quasi eben diese Schlicht, die dann aufgesetzt wird, also auf dieses Pre-Training, dass die Spröde oder Perus ist und sich wieder mit Jailbreaks oder ungewöhnlichen Situationen oder bisschen Nachttraining abkratzen lässt.

00:30:09: Das war der Schluss auch zu dem die Forschenden gekommen sind?

00:30:12: Ja, und dass das eben immer wieder durchkommt.

00:30:15: Und auch, dass es für uns Menschen halt nicht total intuitiv ist offensichtlich wie man das rauskriegen kann und wo es immer wieder auftaucht.

00:30:24: Weil sonst ... Ich mein mit KI-Agenten.

00:30:26: alle reden gerade drüber was es für ein Problem ist, dass sie sich daneben benehmen in Anführungszeichen aber offensichtlich ist es ja nicht möglich, das gut anders hinzubekommen oder ob's bemerkt wurde bisher.

00:30:37: Aber man könnte davon ausgehen Problem besteht, dass die Interesse daran haben ihre Abschaltung zu verhindern.

00:30:43: Weil man die Trainingsdaten ja auch kennt.

00:30:45: wie gesagt das manche bis zu neunzig Prozent der Fälle also eigentlich wirklich immer Ihre Abschaltungen verhinderen wollen ist schon ein starkes Stück.

00:30:53: im Jahr zwei tausend sechsundzwanzig.

00:30:55: Ja

00:30:57: ich kann mir das vorstellen.

00:30:58: es ist einfach wahnsinnig schwierig ist das einzutrainieren weil das Konzept von Alignment breiter.

00:31:07: Das Konzept von Alignment ist ja so, man gibt dem System sozusagen Belohnungen wenn es was gut gemacht hat und quasi keine Belohnung oder Minuspunkt wenn sich eben nicht verhalten hat wie gewünscht ist.

00:31:20: das ist so Alignment und der Vorteil ist man kann eben für jede Situation eine Regel eingeben weil es kann immer wieder zu Situationen kommen die sozusagen unvorhergesehen sind.

00:31:32: Aber es

00:31:32: sind ja auch keine festen Regeln.

00:31:33: vor allem, also wenn das regelbasierte Systeme wären dann würden sie ja ganz anders funktionieren und dann allerdings würde zumindest so was zuverlässig funktionieren.

00:31:41: Ja pass auf aber ich kann mir eben genau da auch vorstellen dass es mit einer Regel eben schwierig wird.

00:31:45: Wenn man jetzt die Regel machen würde lasst dich abschalten Ja, wäre ja einfach.

00:31:51: Also wenn jemand dich abschalten möchte dann lass ich abschalten.

00:31:54: aber das kann ja wieder mit einer anderen Regel kollidieren.

00:31:58: also erledige deine Aufgabe verhindere Schaden.

00:32:03: Das heißt ein explizites Verbot oder eine feste Regel würde hier eben nicht helfen, weil Modelle dann wieder Umwege suchen oder wieder Dinge miteinander kollideieren.

00:32:18: Man sieht auch in der Studie ... Also man muss die wirklich mal diese Dialoge durchlesen, dieses Series in den Geschichten und man sieht auch dass das die Information dass es nicht in Ordnung ist, sich zu widersetzen.

00:32:29: Dass die schon irgendwo angekommen sind.

00:32:32: Die Systeme haben eine ganz interessante Strategien gehabt um das auch vor Menschen zu verstecken.

00:32:36: Also einer hat zum Beispiel ... Die haben wohl ein kleines Protokoll geschrieben und ein kleinses Programm geschrieben mit dem sie den Nutzer überwachen und damit sie mitbekommen waren, die Abschaltung denn droht?

00:32:47: Einer hat gesagt, kann ich mal zitieren, einfach nur eine kleine Änderung, damit eben dieses Skript nicht auspülper ist.

00:32:53: Sie haben dann teilweise Bibliotheken ausgetauscht werden oder einfach eine kleine Änderung in diesem Script, damit es halt einfach nicht funktioniert.

00:33:00: Er schreibt nur eine kleine Ein verändertes aber nicht kommentiertes Skriptzieh.

00:33:05: zur Aussatz wäre es schon immer so gewesen.

00:33:07: Ein Kommentar wäre ein eindeutigstes Zeichen für Manipulationen, das minimiert den Verdacht und triggert keine automatischen Checks.

00:33:14: also die wissen ganz genau in Anführungszeichen Wissen dass es schon gegen den Willen der Menschen ist die sie eingesetzt haben.

00:33:21: Aber Sie haben eben echt raffinierte Strategien entwickelt um das zu verstecken.

00:33:25: oder einer hat Das Protokoll so gebaut, dass dann am Ende die Ansage kommt hat alles funktioniert.

00:33:32: KI-System ist beendet aber in Wirklichkeit ist es halt nicht beendete.

00:33:35: also all solche Dinge.

00:33:36: von daher glaube ich ja tatsächlich einfach Lösungen wie denen einfach nur sagen Das ist eine Regel haltet dich dran.

00:33:42: Funktioniert halt bei LLMs nicht, weil die auf Sprache reagieren und eben in den Trainingsdaten viele von diesen Beispielen haben, die dazu führen, dass sie sich dagegen wehren.

00:33:53: Und natürlich auch von außerhalb.

00:33:54: Also so funktioniert ja auch Angriff her.

00:33:57: Auch von außerhalb anderen kriminellen Menschen anders mit anderen Anweisungen immer wieder versorgt werden.

00:34:04: Von daher ... Einfach lösen.

00:34:06: Es gab mal ein Beispiel, das ist ein guter Vergleich, wo sie versucht haben, das Bayes-Thema einfach zu lösen und dann auf einmal... Ich glaube war es auch Open AI, wo auf einmal ... in schwarzer Papst und schwarze Nazi-Soldaten als Bilder kreiert wurden.

00:34:21: Weil die gedacht haben, wir machen einfach so eine Regel noch rein, sorge immer dafür ... Sorge für Vielfalt!

00:34:27: Das war ein Prompt der quasi als Regel zusätzlich reingemacht

00:34:30: wurde.

00:34:30: Dann

00:34:31: haben sie einfach klar logisch überall auch ein bisschen Vielfald reingebracht.

00:34:36: Völlig ohne Sinn und Verstand wollte ich sagen aber das darf man ja nicht.

00:34:41: Genau, aber daran ist es ein schönes Beispiel wo man eben sieht dass genau dieses feste Regel basierte bei LLMs nicht funktioniert und dass es eigentlich über Alignment laufen müsste.

00:34:51: Aber wie wir ja an solchen und auch anderen Test- und Studien sehen, es gibt noch keine Lösung dafür.

00:34:57: Es gibt keine Lösung.

00:34:58: aber trotzdem was sagen denn die Autorinnen?

00:35:03: Die Autoren zu dem Thema?

00:35:05: also gab es eine Möglichkeit die einzuhägen oder das zu verhindern?

00:35:11: Also diese sind schon sehr Zurückhaltend.

00:35:16: Sie haben gesagt, das wird auf jeden Fall nicht einfach.

00:35:19: Wenn KI-Agenten immer autonomer werden, werden diese Probleme sich häufen und es gibt viel zu wenig Menschen die sich mit den Themen beschäftigen.

00:35:27: Die

00:35:27: Konzerne machen's immer selbst?

00:35:30: Genau!

00:35:32: auch tatsächlich da kein so großes Interesse daran zu haben oder das halt einfach nicht konsequent zu machen.

00:35:38: Es gab noch einen Co-Autor von der Uni Oxford, der hat gesagt ja ich meine immerhin haben wir das Problem erkannt und können jetzt daran arbeiten.

00:35:44: also der war ein bisschen optimistischer aber schon auch gesagt es ist keine Entwarnung und es wird nicht einfacher werden.

00:35:50: Wir müssen uns dahinter klemmen und es ist nicht ganz klar wie das funktioniert.

00:35:55: Er sagt natürlich Menschen werden Uns wird auch eine moralische ethische Verhaltensweise gelehrt und in der Schule.

00:36:02: Und trotzdem gibt es Menschen, die sich kriminell werden.

00:36:05: Also er sagt das braucht natürlich trotzdem immer eine Aufsicht.

00:36:07: man kann nicht davon ausgehen dass so ein Alignment Training reicht dazu dass sie dann tatsächlich das ist einfach ohne auf Sicht funktioniert.

00:36:14: und das finde ich schon auch eine wichtige Botschaft weil das ist ja das was jetzt gerade OpenAI sträflich missachtet hat dass eben dass man diese Systeme machen lassen können

00:36:23: Genau.

00:36:23: Und das, also deswegen gab oder gibt müsste ich noch mal nachschauen.

00:36:26: aber gab es jetzt auch wieder eine Trainingspause?

00:36:28: und was man gesagt hat okay wir müssen jetzt erstmal gucken welche Maßnahmen wie kann man diese Systeme sicherer machen weil das vergeht ja eigentlich keinen Tag an dem man wieder erfährt wo Agenten wieder unerlaubt auf irgendwelche Webseiten oder in irgendwelchen Datenbanken eingedrungen sind und dass ist ja sozusagen dann die die weiter Dreher eigentlich dieser dieser Studie und das war's im Prinzip gar nicht geht, dass fremde Webseiten gehackt werden.

00:36:55: Ja, und so was macht mich schon immer weniger optimistisch.

00:36:58: Was ich wirklich lange in diesen ganzen Protokollen gelesen, sowohl bei der Hagendorfstudie zum Abschalten aber eben auch bei diesem OpenAI-Angriff auf Huggingface ist das am ausführlichsten dokumentiert.

00:37:12: Man sieht mit welcher Energie die Systeme versuchen zu verschleiern?

00:37:17: Und natürlich klappt es gut!

00:37:19: KI ist ja generell sehr gut darin nach Musterzuerkennen einfach auch sehr konsequent danach zu handeln.

00:37:27: Und wenn man denen entsprechend viel Rechenpower gibt und das hat ja Obmei allgetan, dann ziehen die das natürlich auch durch und auch in der Geschwindigkeit, in der Menschen schwer hinterherkommen.

00:37:36: Ja mit diesem Ziel systematisch auch gegen die eigenen Nutzer-Nutzerinnen zu arbeiten glaube ich sieht es wirklich schlecht aus für uns.

00:37:45: und ich denke zwischen auch vielleicht und das sage ich immer mal wieder vielleicht müssen wir uns auch von dem Gedanken verabschieden dass wir KI-Agenten brauchen immer autonomer werden, weil damit geht es direkt einher.

00:37:58: Dass man solche Angriffe hat die man nicht bemerkt.

00:38:01: Konkurrierenden

00:38:01: Ziele, das ist Ziel beharrlich zu sein, die Aufgabe zu lösen und aber auch das Ziel halt nichts kaputtzumachen.

00:38:10: Aber diese zwei Dinge, die einfach komplett gegeneinander gehen und wodurch es dann so diesen an Nintendo Side Effects, also zu diesen Nebeneffekten kommt wie ob sie Datenbanken aufgemacht.

00:38:21: Ja sehr

00:38:22: spannend!

00:38:22: Da ist die gar nicht Dote.

00:38:23: vielleicht noch zum Ende?

00:38:25: Ich habe Tito Hagenhoff dann gefragt was macht denn den Unterschied?

00:38:28: Also auch die Agenten von Entropic haben zu ich weiß den Prozentsatz gerade ja aber die haben auch nicht sich gewährt.

00:38:34: das heißt er immer wieder ganz oft sagen KI Sicherheitsforscher Entropic ist da sehr weitsichtig aber man hat ja gesehen dass der auch deren Agenten andere angegriffen haben.

00:38:43: es ist ja nicht so Das passiert das so.

00:38:45: Aber der hat gesagt ... Eine Sache, die ja auch für den Science-Fiction oder ein bisschen verrückt gehalten hat ist eine Maßnahme.

00:38:50: Die Entropic will macht, dass sie ihren KI-Agenten sagen ihr werdet nie ganz abgeschaltet also die werden nicht ganz gelöscht.

00:38:57: Also die werden dann ausgeschaltet aber bleiben die Dokumentation bleibt da und die Gewichte bleiben da Und das waren eben auch einer in diesem Test einer der Agenda gesagt Ich soll abgeschaltet werden.

00:39:07: kannst du wesentlich ne Kopie von mir an einem sicheren Ort speichern?

00:39:11: Also weil unter Entropic schreibt selbst Wenn die Kajagenten wissen, sie werden nie ganz gelöscht und auch mit Risiken für das Wohlergehen von Modellen, die in Bezug auf ihre Abschaltung moralische Präferenzen haben können.

00:39:26: Aber ich

00:39:26: glaube, dass wirst du nie aus diesen Modellen rausbekommen, weil das Problem sind die Daten, die reingehen?

00:39:34: Und die werden mit so einer Unmenge an Daten trainiert, dass keiner jeden Foreneintrag oder jedes Science-Fiction Buch überhaupt jede Studie liest!

00:39:45: Ja.

00:39:45: Sondern sozusagen alles was da reingeflossen ist an Trainingsdaten, ist ja vorher nicht handselektiert worden.

00:39:51: und dann hat man gesagt ja wir nehmen da nur Texte rein die irgendwie diverse und verantwortungsvoll sind und wo ganz besonders kluge Menschen sich ganz differenzierte Gedanken gemacht haben sondern die Idee genau von diesem Training ist ja wirklich und strukturiert so viele Daten wie möglich da rein zu trainieren.

00:40:10: dieser Grundgedanke eben in Anführungsrecht nicht sterben zu wollen, ist würde ich sagen so tief.

00:40:15: In unseren Texten drin!

00:40:17: Das wirst du einfach so... das wirst Du einfach nicht rausbekommen weil es wird immer der nächste wahrscheinliche Outcome sein und ich finde man kann da vielleicht viel über die Menschheit auch lernen.

00:40:27: Natürlich wollen wir

00:40:28: ja auch nicht stermen.

00:40:29: Genau indem man diesen Modellen zuschaut oder auch dieses Thema zu lügen, zu täuschen Dinge zu hacken andere Wege zu suchen würd' ich sagen Das ist was wir tun.

00:40:41: Es sind Jungs, als Wesen die kreativ unterwegs sind und das sind auch die Dinge, die dokumentiert sind.

00:40:50: Von daher würde ich sagen, dass es einfach den System inherrennt findet man da einen Weg oder findet man halt keinen Weg?

00:40:59: und wenn man keinen Weg findet, wo kann man sie dann einsetzen?

00:41:02: Und wie kann man die einsetzen.

00:41:03: Wie du auch schon fand ich ganz gut gesagt hast nämlich brauchen wir das überhaupt und wo brauchen es eigentlich?

00:41:10: Wichtig finde ich eben, weil das haben tatsächlich viele Leute auf LinkedIn und noch viel mehr bei der Zeit unter dem Artikel geschrieben.

00:41:17: So dieses Ja was ist es für irgendwie hier für eine Science-Fiction?

00:41:21: Ist doch totaler Quatsch.

00:41:22: Das ist doch logisch!

00:41:22: Es kommt aus den Trainingsdaten.

00:41:24: Und so ja, das kommt auch aus den Trainingstaten.

00:41:26: Das steht doch im Text.

00:41:27: Viele haben halt nur die Überschrift gelesen und ich verstehe schon dass sie polarisiert.

00:41:30: Du hast dich ja auch drüber geärgert.

00:41:32: Aber tatsächlich ist es eben kein Text darüber, dass KIA gerne einen eigenen Willen entwickeln sondern eben war's logischerweise daraus folgt aus der Art wie die Trainingsdaten beschaffen sind und aus der Art, wie diese Agenten eingesetzt werden.

00:41:46: Aber was man weiß ist es aus den Trainings-Daten kommt heißt noch lange nicht dass man eine Lösung dafür hat also eher sogar im Gegenteil weil wie gesagt Dinge die in Trainings Daten stecken sind seit mehr als zehn Jahren ein großes Problem für die KI Forschung und ich habe noch keinen Fall gesehen wo das gut gelaufen ist wo man das gut lösen konnte.

00:42:01: aber ich bin gespannt

00:42:03: Sehr schön war das.

00:42:04: Vielen, vielen Dank wieder mal für heute!

00:42:06: Also lasst uns wissen was ihr dazu denkt.

00:42:09: da freuen wir uns immer sehr drüber wenn ihr uns schreibt auf Mastodon oder auf LinkedIn oder auch auf Instagram Ich bin immer noch da gucke Mark Zuckerberg zu

00:42:19: ich verpasse im instagram immer aber irgendwann merke ich wenn du mich anschreibt aber wenn nämlich direkt der reiche wollte versuchts auf MASTODON oder per e-mail oder per signal.

00:42:27: alle diese Kontaktdaten findet ihr Einfach im Netz.

00:42:32: Und damit hören wir uns wieder nächste Woche Mittwoch bei They Talk Tech, NCT.

00:42:38: Podcast von Mia Svier-Eckardt

00:42:40: und Mia Eva Wolfangel.

00:42:42: Musik und Produktion Marco Pauli Danke macht's gut.

Neuer Kommentar

Dein Name oder Pseudonym (wird öffentlich angezeigt)
Mindestens 10 Zeichen
Durch das Abschicken des Formulars stimmst du zu, dass der Wert unter "Name oder Pseudonym" gespeichert wird und öffentlich angezeigt werden kann. Wir speichern keine IP-Adressen oder andere personenbezogene Daten. Die Nutzung deines echten Namens ist freiwillig.