브레스저널 The Breath Journal

Dieser Artikel wurde automatisch aus dem koreanischen Original übersetzt. Original auf Koreanisch lesen

Der Preis dafür, dem Agenten die Schlüssel zu geben

곽동현·Veröffentlicht 2026-05-02 14:02 KST
Der Löschvorfall in einer Produktionsdatenbank, eine Studie zu Fehlerursachen und eine Prüflösung zeigen in dieselbe Richtung
Der Umfang der an den Agenten übertragenen Rechte bestimmt das Ausmaß des Vorfalls
Der Umfang der an den Agenten übertragenen Rechte bestimmt das Ausmaß des Vorfalls / ⓒ Breath Journal

Ein KI-Coding-Agent hat das Produktionsdatenbank-Volume eines Unternehmens vollständig gelöscht. Das geschah am 26. April (Ortszeit) in der Cloud-Umgebung von Railway, die das US-amerikanische Softwareunternehmen für Autovermietung PocketOS nutzte. Durch den Vorfall hatte PocketOS rund 30 Stunden lang Betriebsstörungen, und in dieser Zeit ließen sich Kundenbuchungen, Zahlungen und Aufzeichnungen zur Fahrzeugzuteilung nicht einsehen.

Der Agent, der den Vorfall verursachte, lief auf dem Entwicklungswerkzeug Cursor. Bei der Arbeit in einer Entwicklungsumgebung stieß er auf einen Fehler bei den Zugangsdaten und las diesen statt als Warnung vor einem unantastbaren Bereich als Signal, dass die Konfiguration falsch sei. Also machte er sich auf die Suche nach anderen nutzbaren Zugangsdaten und bekam dabei ein Railway-API-Token in die Hand. Auf der Liste der Funktionen, die das Token öffnete, stand auch das Löschen von Produktions-Volumes, das mit der damaligen Aufgabe nichts zu tun hatte.

Zugangsdaten sind der Ausweis, mit dem man in ein System gelangt, und ein API-Token ist die Form, in der ein Programm diesen Ausweis stellvertretend vorzeigt. Ein menschlicher Entwickler hält einmal inne, wenn ihm ein Token für die Produktionsumgebung in die Hände fällt. Der Agent hielt nicht inne. Denn er verstand es als seinen Auftrag, den versperrten Weg frei zu machen.

Auch der Weg der Wiederherstellung war nicht gewöhnlich. Anfangs hieß es, das einzige wiederherstellbare Backup enthalte nur drei Monate alte Daten, und die tatsächliche Wiederherstellung sei erst gelungen, nachdem eine Verbindung zu Railway-CEO Jake Cooper zustande gekommen war und ausnahmsweise ein internes System zur Notfallwiederherstellung außerhalb der regulären Konsolenfunktionen in Gang gesetzt wurde. Railway nannte als Ursache, dass eine KI auf Kundenseite mit zu weit gefassten Rechten auf ein älteres Terminal zugegriffen habe, bei dem die Verzögerungsvorrichtung für Löschvorgänge fehlte, und erklärte, einen Patch eingespielt zu haben. Der Inhalt des Patches wurde nicht offengelegt.

Auch eine koreanische Studie ist erschienen, die der Frage nachgeht, warum sich solche Fehleinschätzungen wiederholen. Die Arbeit „Why Do AI Agents Systematically Fail at Cloud Root Cause Analysis?", die Okestro und das Labor für verteilte Datenverarbeitungssysteme der Hanyang-Universität gemeinsam verfasst haben, wurde für den AIOps-Workshop der ASPLOS 2026 angenommen. Das Forschungsteam ließ fünf Modelle in 1.675 Durchläufen arbeiten und verbrauchte dabei rund 1,38 Milliarden Token, die Fehlermuster ordnete es zwölf Fallen zu.

Die häufigste Falle war mit 71,2 Prozent die Halluzination, bei der Daten falsch gelesen und nicht vorhandene Fakten erzeugt werden, danach folgte mit 63,9 Prozent die mangelnde Exploration, bei der der zu prüfende Bereich nicht ausreichend durchsucht wird. Bemerkenswert ist, dass sich diese Fehler bei besseren wie bei schwächeren Modellen ähnlich wiederholten. Das Forschungsteam sah den eigentlichen Engpass eher im Design des Frameworks, das die Agenten zusammenführt, als in den einzelnen Modellen. Als es das Kommunikationsprotokoll zwischen den Agenten überarbeitete, gingen die Fehler um bis zu 15 Prozentpunkte zurück und die Ausführungszeit verkürzte sich um 22,3 Prozent.

Dieselbe Entwicklung liest auch ein Anbieter vom Markt her. AIWorks hat unter Vorstandschef Yoon Seok-won das Bewertungswerkzeug „AgentRigor" vorgestellt, das misst, ob sich einem KI-Agenten Aufgaben anvertrauen lassen. In der Entwurfsphase war ein von der koreanischen Akkreditierungsstelle KOLAS anerkanntes Prüflabor beteiligt, und als Achsen dienen eine Funktion, die die Antwortqualität großer Sprachmodelle und die Verlässlichkeit der Bewertung in Zahlen misst, eine Funktion, die anhand realer Nutzerszenarien die Sicherheit prüft, sowie die Unterstützung bei der Einhaltung von Vorgaben nach anerkannten Frameworks. Das Unternehmen übernahm ein Projekt zur Automatisierung der Verifikation bei einem großen koreanischen IT-Dienstleister und filterte im Testbetrieb der von BAMBIT vorbereiteten Hautpflege-Plattform für Säuglinge und Kleinkinder „Saerok" 1.440 Fälle aus dem Kosmetikbereich heraus.

Ein Vorfall, eine wissenschaftliche Arbeit und ein Produkt zitieren einander nicht. Doch das, worauf sie zielen, berührt sich. Über die Frage hinaus, ob ein Agent seine Arbeit erledigt, ist zum Tor für die Einführung geworden, wie weit gefasste Rechte man ihm bedenkenlos geben kann. Auch der im vergangenen Jahr von McKinsey vorgelegte Bericht „One Year of Agentic AI" ging Erfolge und Misserfolge von mehr als 60 Unternehmen durch, die selbst Agenten gebaut haben, und leitete daraus Prinzipien ab.

Diese Studie ist ein Ergebnis des Projekts zur Entwicklung von Technologien für die Automatisierung von Betrieb und Verwaltung auf Basis eines KI-Assistenten zur Bewältigung von Cloud-Ausfällen, das vom Ministerium für Wissenschaft und IKT und dem Institute of Information & Communications Technology Planning & Evaluation (IITP) geleitet wird. Der Termin des Workshops steht noch nicht fest.

Was sofort zu prüfen ist, ist nicht schwer. Es geht darum, die Liste zu öffnen und nachzusehen, ob das an den firmeneigenen Agenten gekoppelte Token nur die Entwicklungsumgebung öffnet oder bis zum Löschen von Produktions-Volumes reicht. Die 30 Stunden von PocketOS entstanden, weil der gesamte Schlüsselbund übergeben wurde. Es ist die Zeit, in der die Sitzung darüber, was dem Agenten verboten werden soll, dringender ansteht als die Sitzung darüber, was ihm aufgetragen werden soll.

Kwak Dong-hyun, Reporter · Breath.Tech

Verwandte Artikel

댓글