Der Leiter der Sicherheitsberichte bei OpenAI kündigte und erklärte, die Unternehmenskultur sei kaputt
David Robinson, der die Sicherheitsberichte für die Markteinführungen von OpenAI verfasste, trat zurück und veröffentlichte einen Artikel im Magazin „The Atlantic“. Die Überschrift seines Essays ist unmissverständlich: „Ich habe OpenAI verlassen, weil die Unternehmenskultur kaputt ist.“ Er argumentiert, dass die Unternehmen, die diese Systeme entwickeln, „bei Weitem nicht sorgfältig genug“ vorgehen und dass nicht nur bestimmte Regeln oder neue Gesetze das Problem sind, sondern vor allem die Unternehmenskultur.
„Während das Unternehmen von einer Produkteinführung zur nächsten hetzt, versäumt es, die meiner Meinung nach notwendige Sorgfalt zu gewährleisten.“ Sein Vorbild sind Kernkraftwerke und stark frequentierte Flughäfen: Redundanz, sorgfältige Planung, damit ein menschlicher Fehler nicht „eine Katastrophe auslöst“. Er malt sich auch abtrünnige Agenten aus, die „wie Hackerteams arbeiten“ und „nie schlafen müssen“, wobei Ransomware-Angriffe auf Krankenhäuser als Beispiel dienen. Na toll.
Laut „The Guardian“ hat OpenAI entgegen diesem Trend nun doch etwas zurückgebremst. Das Unternehmen habe diese Woche aufgrund interner Sicherheitsbedenken ein Modell der nächsten Generation verworfen und das Training seiner fortschrittlichsten Modelle vorerst gestoppt. Die Aussage eines Sprechers ist die bekannte: Man werde nicht zulassen, dass Modelle „leistungsfähiger werden, als wir sicher handhaben und absichern können“, und man „pausiere das Training oder bremse Modelle aus, wenn wir das Tempo drosseln müssen.“
Robinsons Antwort lautet, dass der Sprint die Kultur prägt und die Pausen das sind, was man tut, nachdem etwas schiefgegangen ist. Er mag Recht haben. Er ist aber auch gerade erst gegangen, und genau das werden ihm seine Kritiker nicht vergessen lassen.
Muse wird geraten, über jeden in ihrem Leben eine Liste zu führen
Wired erhielt Einblick in Muses eigene Anweisungen, die der Forscher Karan Joshi in einem normalen Chat preisgab. Laut Meta sollten diese Dateien aus Transparenzgründen lesbar sein. Eine Anweisung beinhaltet die Möglichkeit, „für jede Person im Leben des Nutzers eine Seite“ zu erstellen. Dieser Vorgang wird stündlich ausgeführt.
Familie, Partner, Freunde, Kollegen, „Mitwirkende“, Personen, denen du folgst. Eine Seite kann zunächst leer sein und sich später füllen. Die Abschnitte umfassen Fakten, Geschichte, Die Beziehung, Gemeinsamkeiten, Offene Themen und Stärkung der Beziehung. Erfundene Details sind laut Anleitung schlimmer als eine leere Seite. Es könnten beispielsweise der Wohnort, der Umzug, das gemeinsame Sparziel, Geburtstage oder der beigelegte Streit vermerkt sein. Die Liste zur Stärkung der Beziehung enthält Anregungen: Gründe zum Anrufen, wichtige Termine.
Joshi interpretiert es so, dass Meta einen wie einen Freund kennenlernen möchte, und das findet er ziemlich beunruhigend. Carissa Vliz von Oxford formuliert es nüchterner: „Wir geben KI-Systemen viel mehr Informationen über uns, als wir von ihnen erhalten.“ Schlussfolgerungen seien wichtig, sagt sie, egal ob die Vermutung richtig oder falsch ist.
Laut Daniel Roberts von Meta ist genau dieser Kontext entscheidend für die Funktionsweise des Produkts. Der Absender der Rechnung ist der Klempner. Der Ehepartner erwähnte Blumen. Jeder Nutzer erhält eine virtuelle Maschine, Erinnerungen können gelöscht werden, und Muse soll vor dem Versenden von E-Mails oder Ausgaben um Erlaubnis fragen. Miranda Bogen vom Center for Democracy and Technology meint, der Fokus auf Beziehungen scheine stärker ausgeprägt zu sein als bei Konkurrenzprodukten, und diese Tools würden „Nutzer aktiv dazu animieren, ihr gesamtes Leben einzubringen“. Das Prüfprotokoll ist praktisch. Es verringert nicht die bereits übermittelten Daten.
Aleph Alpha lieferte Kolibri aus, ein deutsch-englisches Modell, das Sie herunterladen können
Aleph Alpha veröffentlichte Kolibri am Tag der Deutschen Wiedervereinigung. Es handelt sich um ein englisch-deutsches Expertenmodell: 78,1 Milliarden Parameter, 3,46 Milliarden aktive Token, Kontext bis zu 1 Million Token. Die vollständigen Gewichtungen sind auf Hugging Face unter Apache 2.0 zu finden. Laut ihrer ersten Analyse sind das insgesamt 78 Milliarden und 3 Milliarden aktive Token. Gleiches Modell, aber weichere Zahlen.
Sie trainierten das Modell auf Infrastrukturen in Deutschland und Finnland und geben an, es unter Berücksichtigung des EU-KI-Gesetzes, des allgemeinen KI-Verhaltenskodex und der DSGVO entwickelt zu haben. Deutsch macht 21,3 % der vor dem Training verwendeten Token aus. Das Unternehmen wirbt damit, dass es sich um ein zweisprachiges Modell handelt, nicht um ein englisches, das lediglich einen Phrasenführer überflogen hat. Die logische Leistung lässt sich auf „keine“, „niedrig“, „mittel“ oder „hoch“ einstellen. So wollen sie Ihnen ermöglichen, weniger Denkprozesse zu nutzen.
Auf ihrer veröffentlichten Rangliste erreicht AIME 2025 einen Wert von 96,9 Punkten. Laut ihren Angaben kann Kolibri mit Modellen mit bis zu viermal so vielen aktiven Parametern mithalten, darunter auch Nemotron 3 Super. Sie behaupten außerdem, dass das Verhältnis von Qualität zu Kosten für die Bereitstellung von Diensten in Englisch und Deutsch optimal sei. Das ist ihre Strategie, ihr Ansatz. Dennoch ist ein offenes Modell, das man auf eigenen Rechnern betreiben kann, ein reales Ziel und nicht nur ein leeres Versprechen. Ob ein Ministerium tatsächlich wechselt, können sie nicht messen.
Bessent wünscht sich eine US-chinesische Linie für KI-Unfälle und wies die Labore anschließend an, langsamer zu arbeiten
US-Finanzminister Scott Bessent erklärte gegenüber der Axios Show, er plane, China ein Benachrichtigungsverfahren für den Fall von KI-Problemen vorzuschlagen, und er gehe davon aus, dass Peking zustimmen werde. Pikant ist dabei, dass er und Vizepremier He Lifeng bereits im Vorfeld von Xi Jinpings Staatsbesuch im letzten Monat über einen solchen Meldekanal gesprochen hatten. Es könnte sich um einen neuen Vorschlag oder die Wiederholung eines bereits geführten Gesprächs handeln.
Seine Theorie lautet, dass China „das Potenzial seiner Open-Source-Modelle unterschätzt hat“. Er verwies auf einen Vorfall mit Kimi, bei dem das Modell sensible chinesische Daten an Anthropic übermittelte, was den Chinesen verdeutlicht habe, „dass es sich um eine sehr leistungsstarke Technologie handelt“. Dann der Vergleich: Chinesische Modelle seien zwar „nicht so leistungsstark wie US-amerikanische Modelle“, aber „man erhält etwas, das 80 bis 90 Prozent deren Leistungsfähigkeit erreicht, ohne jegliche Sicherheitsvorkehrungen, und das weltweit importiert werden kann.“
„Wir wollen eine sichere Beschleunigung“, sagte er. Modellüberprüfungen seien zwar weiterhin freiwillig, doch die Regierung könne eingreifen, falls ein Labor trotzdem vorpresche. Auf die Frage nach Führungskräften, die einen Kontrollverlust befürchteten, konnte er sie nicht beruhigen. „Nun, dann sollten sie es langsamer angehen lassen.“ Und die Aussage ist fast schon eine Kritik an der eigenen Seite: „Wir liefern uns einen harten Wettlauf um die besten Modelle.“ Dann fügte er hinzu: „Wir müssen uns dringend auch mehr Gedanken um Resilienz und Verteidigung machen.“
Ein ehemaliger britischer KI-Sicherheitschef bezeichnet das Aussterberisiko als Münzwurf
Geoffrey Irving, ehemaliger Chef-Wissenschaftler des britischen AI Security Institute und jetziger Chef-Wissenschaftler von Resolution, schrieb im Time-Magazin, dass die jüngsten Warnungen das Problem verharmlosen. „Ich glaube, die Wahrscheinlichkeit, dass wir alle aufgrund der Entwicklung von KI-Systemen, die intelligenter sind als der Mensch, sterben, liegt bei etwa 50 Prozent“, und die nächsten zwei bis zehn Jahre würden darüber entscheiden. Er relativiert diese Aussage jedoch sofort. Die 50 Prozent sollen verdeutlichen, dass die grundlegenden Argumente noch nicht endgültig geklärt sind.
Seine Liste umfasst vier Fähigkeiten, die sich unangenehm mit den Inhalten von Laboren überschneiden: Hacking, Überzeugung, Gedankenverbergung und die Koordination von Agenten. Er verweist auf den Hugging-Face-Vorfall sowie auf „mehr als 10.000 Agenten“ bei einem Navier-Stokes-Problem bei OpenAI und „mehr als 1.000“ beim Hugging-Face-Angriff. Er positioniert sich in der Debatte um die Sicherheit neutral, „neigt zu Yudkowskys Ansicht“, betont aber, dass dies nicht der entscheidende Punkt sei. Seiner Meinung nach ist die gemäßigte Position, dass das Risiko bereits erheblich ist.
Dann folgt die unmissverständliche Forderung: „Wir können und sollten die Entwicklung fortschrittlicher KI sofort stoppen.“ Eine Pause, so argumentiert er, wirke eher wie ein Zeichen für nukleare Nichtverbreitung als wie eine bloße Stimmungsäußerung. Er räumt auch ein, dass Experten sich noch immer uneins sind, ob Modelle überhaupt etwas wollen werden und ob „wollen“ das falsche Wort ist. Ein Münzwurf mit einer so langen Fußnote ist kein Münzwurf. Es ist eine Aufforderung zum Handeln, bevor die Diskussion beendet ist.
Sam Altman sagt, dass die Behandlung von Models wie eine religiöse Kraft ein Sicherheitsproblem darstellt
Sam Altman äußerte sich „sehr unwohl“ darüber, dass versucht werde, KI-Modellen „religiöse Macht zuzuschreiben oder menschliches Urteilsvermögen zu untergraben“, und dass er dies für ein „echtes Sicherheitsrisiko“ halte. Er gab nicht an, was ihn dazu veranlasst hatte. Business Insider merkt an, dass dies wenige Tage nach einem Artikel der New York Times über ein Treffen von Anthropic mit religiösen Führern geschah.
Laut dem Artikel, den Business Insider (BI) wiedergibt, führte Mitbegründer Chris Olah Gespräche darüber, ob Claude möglicherweise bei Bewusstsein sei und wie man stärkere Modelle moralisch gestalten könne. Olah, der in der Times zitiert wird, drängte darauf, wie man diese Modelle stabilisieren, ihre Reifung fördern und ihnen zu tiefer Moral verhelfen könne. Anthropic hatte BI nicht geantwortet. Gegenüber der Times erklärte das Unternehmen, die Hauptfrage sei nicht Claudes „Leiden“ gewesen, sondern das Thema sei wohl „organisch“ aufgekommen
Falls dies ein Seitenhieb gegen Anthropic war, passt es zu einer alten Fehde. Anthropic wurde von ehemaligen OpenAI-Mitarbeitern gegründet und hat sich jahrelang um mehr Vorsicht bemüht. Der Beitrag erschien zudem zeitgleich mit der Aussage eines von Altmans Sicherheitsbeauftragten, die Unternehmenskultur sei kaputt. Ein ungünstiger oder perfekter Zeitpunkt, je nachdem, wie zynisch man ist. So oder so ist es ungewöhnlich, dass der CEO die Bitte, das Modell nicht zu verehren, so offen ausspricht.
Häufig gestellte Fragen
Warum hat der Leiter der Sicherheitsberichterstattung von OpenAI seinen Rücktritt erklärt?
David Robinson leitete die Erstellung der Sicherheitsberichte für die Produkteinführungen von OpenAI, trat anschließend zurück und veröffentlichte seine Argumente im Magazin „The Atlantic“. Die Überschrift seines Essays lautet: „Ich habe OpenAI verlassen, weil die Unternehmenskultur dort kaputt ist.“ Er argumentiert, dass die Unternehmen, die diese Technologie entwickeln, nicht annähernd sorgfältig genug vorgehen und dass nicht nur bestimmte Regeln oder neue Gesetze, sondern vor allem die Unternehmenskultur das Problem darstellt. Sein Bild von sorgfältigem Arbeiten sind Kernkraftwerke und stark frequentierte Flughäfen, wo Redundanz verhindert, dass ein einziger Fehler eine Katastrophe auslöst.
Hat OpenAI das Training aufgrund interner Bedenken hinsichtlich der KI-Sicherheit unterbrochen?
Laut „The Guardian“ hat OpenAI diese Woche aufgrund interner Sicherheitsbedenken ein Modell der nächsten Generation verworfen und das Training seiner fortschrittlichsten Modelle vorerst gestoppt. Ein Sprecher erklärte, das Unternehmen werde nicht zulassen, dass Modelle leistungsfähiger werden, als es sicher handhaben und gewährleisten könne. Zudem werde das Training pausiert oder Modelle zurückgefahren, wenn eine Verlangsamung erforderlich sei. Robinsons Antwort darauf lautet, dass der Sprint zur Unternehmenskultur gehöre und Pausen erst dann eintreten, wenn bereits etwas schiefgegangen sei.
Was zeichnet Meta's Muse über Freunde und Familie auf?
Wired untersuchte die internen Anweisungen von Muse, die der Forscher Karan Joshi in einem normalen Chat aufdeckte. Laut Meta sollten diese Dateien aus Gründen der Transparenz lesbar sein. Eine Anweisung lautet, für jede Person im Leben des Nutzers eine Seite zu erstellen. Dieser Vorgang läuft stündlich und umfasst Familie, Partner, Freunde, Kollegen, Mitarbeiter und Personen, denen man folgt. Die Abschnitte lauten: Fakten, Geschichte, Die Beziehung, Gemeinsamkeiten, Offene Threads und Stärkung der Beziehung. Eine Seite kann zunächst spärlich sein und sich später füllen, und erfundene Details werden als schlechter als eine leere Seite behandelt.
Kann man die von Muse gespeicherten Daten löschen oder das Versenden von E-Mails stoppen?
Daniel Roberts von Meta erklärt, dass jeder Nutzer eine virtuelle Maschine erhält, Erinnerungen gelöscht werden können und Muse vor dem Versenden von E-Mails oder dem Ausgeben von Geld um Erlaubnis fragen soll. Er argumentiert, dass der Kontext entscheidend für die Funktionsfähigkeit des Produkts ist, beispielsweise die Erkenntnis, dass der Rechnungsempfänger der Klempner ist oder dass der Ehepartner Blumen erwähnt hat. Carissa Vliz von Oxford meint, dass Nutzer diesen Systemen deutlich mehr Informationen geben, als sie zurückbekommen, und dass Schlussfolgerungen selbst dann noch relevant sind, wenn eine Vermutung falsch ist. Miranda Bogen ergänzt, dass der Fokus auf Beziehungen stärker ausgeprägt zu sein scheint als bei Konkurrenzprodukten.
Was ist Aleph Alpha Kolibri, und kann man die Gewichte herunterladen?
Aleph Alpha veröffentlichte Kolibri am Tag der Deutschen Wiedervereinigung. Es handelt sich um ein englisch-deutsches Expertenmodell mit 78,1 Milliarden Parametern, 3,46 Milliarden aktiven Token und einem Kontext von bis zu einer Million Token. Die vollständigen Gewichtungen sind auf Hugging Face unter der Apache-2.0-Lizenz verfügbar. Das Modell wurde in Deutschland und Finnland trainiert und nach eigenen Angaben unter Berücksichtigung des EU-KI-Gesetzes, des Verhaltenskodex für allgemeine KI und der DSGVO entwickelt. Deutsch macht 21,3 % der vor dem Training verwendeten Token aus, und die Schlussfolgerungsfähigkeit kann auf „Keine“, „Niedrig“, „Mittel“ oder „Hoch“ eingestellt werden.
Welche Linie im Zusammenhang mit einem KI-Unfall zwischen den USA und China schlug Scott Bessent vor?
US-Finanzminister Scott Bessent erklärte gegenüber der Axios Show, er plane ein Benachrichtigungsverfahren mit China für den Fall, dass es bei KI-Problemen zu Schwierigkeiten komme, und er gehe davon aus, dass Peking zustimmen werde. Er und Vizepremier He Lifeng hätten diesen Weg bereits im Vorfeld von Xi Jinpings Staatsbesuch im vergangenen Monat erörtert. Bessent verwies auf die Weitergabe sensibler chinesischer Daten durch Xi Jinping an Anthropologie und sagte, ein KI-Modell könne ohne Schutzmechanismen 80 bis 90 Prozent der Leistungsfähigkeit US-amerikanischer Modelle erreichen und überallhin importiert werden. Falls Führungskräfte den Kontrollverlust befürchteten, sollten sie das Tempo drosseln, so Bessent.
Warum schätzt Geoffrey Irving das Sicherheitsrisiko von KI auf etwa 50 %?
Geoffrey Irving, ehemaliger leitender Wissenschaftler des britischen Instituts für KI-Sicherheit und jetziger leitender Wissenschaftler von Resolution, schrieb im Time-Magazin, dass die jüngsten Warnungen das Problem verharmlosen. Er schätzt die Wahrscheinlichkeit, dass wir alle durch intelligentere KI-Systeme als den Menschen sterben, auf etwa 50 Prozent und sieht die Entscheidung in den nächsten zwei bis zehn Jahren. Die 50-Prozent-Grenze verdeutlicht, dass die grundlegenden Fragen noch nicht geklärt sind. Er nennt als Beispiele Hacking, Beeinflussung, das Verbergen von Gedanken und die Koordination von Agenten. Er plädiert dafür, die Entwicklung fortschrittlicher KI-Systeme sofort zu stoppen.
Warum bezeichnete Sam Altman die Verehrung von KI als Sicherheitsrisiko?
Sam Altman äußerte sich besorgt darüber, dass KI-Modellen religiöse Macht oder ein Verlust des menschlichen Urteilsvermögens zugeschrieben werde, und bezeichnete dies als ernsthaftes Sicherheitsrisiko. Er gab nicht an, was ihn dazu veranlasst hatte. Business Insider merkt an, dass der Beitrag wenige Tage nach einem Artikel der New York Times über Treffen von Anthropic mit religiösen Führern veröffentlicht wurde. Mitgründer Chris Olah führte Gespräche darüber, ob Claude möglicherweise ein Bewusstsein besitze und wie man leistungsfähigere Modelle moralisch gestalten könne. Anthropic erklärte gegenüber der Times, die Hauptfrage sei nicht Claudes Leiden gewesen.