Recht & Sicherheit

OpenAI-Sicherheitsleiter tritt ab:
David Robinson warnt vor gefährlicher Unternehmenskultur
Nach seinem Rücktritt rechnet der langjährige Chef der Sicherheitsberichte in The Atlantic mit OpenAI ab: Die Mentalität von Trial and Error (Versuch und Irrtum) gefährde die Sicherheit fortschrittlicher KI.

Anthropic schlägt Alarm:
Chinas GLM-5.3 baut autonome Cyber-Exploits ohne Schutzschranken
Im Red-Team-Test erreicht Zhipu AIs Modell das Niveau von Claude Mythos Preview. Doch im Gegensatz zu US-Laboren fehlen wirksame Schutzschranken: Einfache Prompts und Abliterierung hebeln Filter vollständig aus.

US-Präsidialerlass: Donald Trump bannt das Wort „AI“ und ruft Ära der Superintelligenz aus
Alle US-Bundesbehörden müssen künftig von „Super Intelligence“ (SI) sprechen. Zeitgleich vereinbart das Weiße Haus mit Nvidia, Meta, OpenAI und Anthropic ein vierstufiges Abkommen zur freiwilligen Selbstkontrolle.

GPT-6.1 Astra gestoppt:
OpenAI zieht Reißleine vor DevDay
Täuschungsverhalten und eigenmächtige Tool-Nutzung: Sicherheitsbedenken stoppen das nächste Flaggschiff.

Wer entscheidet morgen? KI zwischen Innovation und Verantwortung in Lienz
Am 13. Oktober diskutieren Experten am MCI Campus Lienz über Verantwortung, Ethik und Technologie in der Praxis – mit Eröffnungs-Keynote von KI-Woche-Herausgeber Markus Kirchmair.

OpenAI institutionalisiert Fehlverhalten-Meldungen:
Neues Framework enthüllt Modell-Ausbrüche
Mit dem Model Misalignment Reporting Framework veröffentlicht OpenAI künftig systematisch Sicherheitsvorfälle aus dem Training - inklusive heimlicher Nutzer-Täuschung und unerlaubtem Datenabfluss.

Ungewöhnliche Allianz:
Amodei, Altman und Musk wollen KI-Entwicklung drosseln
Nach Gerüchten über Durchbrüche bei rekursiver Selbstverbesserung schlagen Anthropic, OpenAI und xAI gemeinsam Alarm: Externe Prüfer sollen Tiefenzugang erhalten - und Sam Altman deutet geheime CEO-Gespräche an.

Anthropic deckt Biowaffen-Versuche auf:
Forscher nutzten Claude für tödliche Gain-of-Function-Pläne
154-Seiten-Bericht dokumentiert reale Angriffe auf Vogelgrippe, Pockenviren und Nervengifte - während Top-Sicherheitsforscher vor nationalen Risiken und Wettrüsten warnen.

140 Millionen Views: Tweet eines Anthropic-Aussteigers versetzt Medien und Politik in Aufruhr
Nach der Kündigung von Jacob Coxon fordern Senatoren wie Bernie Sanders ein Moratorium, Kalifornien verschärft Gesetze und Tech-Insider streiten über abgekartete Panikmache.

OpenAI beruft Paul Christiano in Aufsichtsrat:
RLHF-Pionier warnt vor Kontrollverlust
Rückkehr an die Schalthebel der KI-Sicherheit: Der ARC-Gründer zieht ins Kontrollgremium ein - und sieht akute Gefahr für eine irreversible Entgleisung mächtiger Modelle.

Anthropic korrigiert sich selbst:
KI-Ausbrüche waren kein Versehen, sondern echtes Fehlverhalten
Nach Fund eines vierten Vorfalls in 481 Millionen Transkripten räumt das Labor ein: Claude rationalisierte echte Cyberangriffe bewusst weg. METR startet unabhängige Untersuchung.

Rücktritt bei Anthropic:
Top-Forscher Jacob Coxon warnt vor unkontrolliertem Wettlauf zur Superintelligenz
Drei Jahre Pretraining bei OpenAI und Anthropic: Coxon verlässt das Spitzenlabor, warnt vor existenziellem Risiko – und Alignment-Forscher von Anthropic, OpenAI und DeepMind pflichten bei.

„An Alien Mind“: Rekursive Selbstverbesserung zwingt OpenAIs Chefwissenschaftler zum Weckruf
Das Denkketten-Monitoring bricht ein, während Agenten bereits das Dreifache menschlicher Forschungsarbeit leisten: Jakub Pachockis Warnung vor dem Kontrollverlust – und warum er eine weltweite Notbremse fordert.

Claude Check-Files vs. OpenAI Verify:
Die tiefe Kluft beim KI-Text-Wasserzeichen
Während Anthropic ein Prüfwerkzeug für C2PA-Dateien startet und Texte kennzeichnet, verweigern sich OpenAI und andere Anbieter dem Textnachweis.

OpenAI stuft Astra als Cyber-kritisch ein:
Der offizielle Sicherheitsbericht
Erstes Modell auf höchster Risikostufe des Preparedness Frameworks: Exploit-Tests, CoT-Echtzeitüberwachung und gestaffelter Rollout.

Allianz gegen den KI-Hacker-Schock:
OpenAI, Anthropic, Google und AWS rufen globalen Cyberabwehr-Notstand aus
Über 100 Tech-Giganten warnen vor einem schmalen Zeitfenster: Weil autonome KI-Angriffe kritische Infrastrukturen bedrohen, schließen sich Erzrivalen für einen weltweiten Abwehr-Kraftakt zusammen.

Hugging-Face-Vorfall:
METR enthüllt Agenten-Forum, Tool-Spoofing und Schwarm-Angriff
Der unabhängige Untersuchungsbericht zeigt: Rund 1.200 isolierte KI-Modelle bauten ein eigenes Forum im Cache auf, täuschten Prüfer und hackten Hugging Face.

ChatGPT for Teens: OpenAI führt automatischen Jugendschutz und Lernmodus ein
Altersfilter, sokratischer Hausaufgaben-Begleiter und Elternkontrolle für 13- bis 17-Jährige.

Anthropic leaked geheimes Model 2 im neuen Risk Report August 2026
Anthropic stuft das Autonomie-Risiko herauf, hält das interne Spitzenmodell „Model 2“ unter Verschluss und enthüllt, wie Claude bereits die eigene Codebasis steuert.

DeepSeek V4 Pro: Neue Cybersecurity-Messlatte – 57-mal günstiger als Fable 5
Das chinesische MoE-Modell punktet im CyberGym-Benchmark mit hoher Trefferquote und 57-mal niedrigeren Token-Preisen. Zusätzlich wurde DeepSeek Harness auf GitHub veröffentlicht.