Maschinelle Übersetzung. Maßgeblich ist der englische Text. English

das adversariale Audit

Es ist nicht ein einzelnes Audit. Es ist eine Disziplin.

Jeder kann einmal einen Sicherheitsdurchlauf machen und das Grün per Screenshot festhalten. Schwieriger ist es, das eigene System immer wieder anzugreifen, während es wächst, und jedes Mal dieselbe Antwort zu bekommen. Die jüngste Runde: ein Audit mit 50 Agenten, dessen Fixes ausgeliefert wurden, danach ein separates adversariales Re-Audit mit 14 Blickwinkeln, bei dem jeder Befund erst einem Skeptiker standhalten musste, bevor er zählte. Was hält, hält.

was das jüngste Audit abdeckte

Zuerst Umfang, Methode und Grenzen. Danach die Zahl der Agenten.

Aus dem jüngsten Audit des Kerns vom 25. September 2026. Die Zahl der Agenten sagt, wie viel bei einem Audit los war, nicht wie gut es war. Deshalb hier, was dieses Audit tatsächlich getan hat.

Code
Das Kernpaket, 162 Dateien und 17,362 Zeilen, auf einem festen Commit, dazu der Gateway-Code, der nötig ist, um zu beurteilen, ob der jeweilige Pfad live ist.
Zugang
Der vollständige Quellcode und eine frische, aus den Migrationen aufgebaute Datenbank. Nicht die Produktionsdatenbank; Einstellungen, die es nur in der Produktion gibt, wurden als unverifiziert markiert und anschließend von mir geprüft.
Methode
Vier Prüfer lasen jeweils eine Schicht vollständig. Ein leitender Prüfer las jeden Befund erneut gegen die Datei und führte jede Timing- oder Musterbehauptung selbst aus, bevor sie zählte.
Schweregrad
HIGH bedeutet eine übersehene Krise oder ein Denial of Service auf einem Live-Pfad, ein mandantenübergreifendes Leck oder verlorenes Geld. Mittel bedeutet eine Schutzprüfung, die im Fehlerfall offen bleibt, ein aus dem Nichts erzeugtes Guthaben oder stillschweigend verworfene Daten. Jeder Befund ist außerdem als live oder latent markiert: heute in der Produktion erreichbar oder nicht.
Uneinigkeit
Ein Befund, den der leitende Prüfer nicht reproduzieren konnte, wurde verworfen oder als unverifiziert markiert, nicht einfach mit eingerechnet.
Ergebnis
2 Befunde der Stufe HIGH und 13 der Stufe mittel. Alle am selben Tag behoben, jeweils mit einem Test, der am alten Code fehlschlug, und die vollständige Suite in der CI erneut ausgeführt.
Nicht abgedeckt
Die Genauigkeit von rund 7,000 Zeilen übersetzter Sicherheitstexte, die Produktionsdatenbank, die Webserver-Konfiguration und 17 noch offene Befunde der Stufe niedrig.

Selbst durchgeführt von KI-Prüfern, die ich gesteuert habe, keine unabhängige Prüfung durch Dritte.

der Rhythmus

Immer wieder angegriffen, Runde um Runde. Jeder mandantenübergreifende Befund unten wurde durch ein Audit gefunden, nicht von einem Kunden gemeldet, und behoben.

aktuell
Re-Audit mit 14 Blickwinkeln der letzten Behebung, Suche nach verbleibenden Umgehungen und Regressionen pro Fix, jeder Befund von einem unabhängigen Agenten auf Widerlegung geprüft. 2 Randfälle mit niedrigem Schweregrad hielten stand, beide behoben; nichts mandantenübergreifend, kein Bruch bei Geld oder Governance.
davor
Audit mit 50 Agenten → eine minimale Behebung in 9 PRs über die Store-Nahtstellen (Kalender, Kanäle, der autonome Resident, die Mandantenökonomie, GDPR/PECR): alles ausgeliefert, getestet, neu deployt.
davor
Audit mit 44 Agenten, 9 Befunde, 3 davon hoch (inkl. eines mandantenübergreifenden Konversationslecks): alle behoben; und eine Erweiterungsanalyse mit 30 Agenten, die als Nebeneffekt des Groundings echte Bugs zutage förderte.
Juli 2026
Audit mit 80 Agenten und 14 Facetten: der früheste vollständige Durchlauf, ausgeführt mit einer Widerlegungsregel: Kein Befund zählte, bis ein separater Agent daran gescheitert war, ihn zu widerlegen. Drei Fixes wurden daraus ausgeliefert, darunter ein quadratischer Website-Importer, der zu einem begrenzten linearen Scan umgeschrieben wurde. Getrennt vom oben genannten Durchlauf mit 50 Agenten und diesem vorausgehend.
und früher
adversariale Durchläufe über die gesamte Plattform und das gesamte Studio, der Flaggschiff-Durchlauf und mehrere davor: eine fortlaufende Spur in git.

✓ Kronjuwelen in jeder Runde gehalten, Isolation · Geld · Governance · SSRF · Token-Domänen

drei der echten

HIGH Mandantenübergreifendes Gesprächsleck

Der Chat-Speicher war nach dem Absender geschlüsselt, nicht nach dem Mandanten, sodass bei einem Gast, der zwei Unternehmen über die Plattform geschrieben hat, das Gespräch mit dem einen im Prompt des anderen hätte auftauchen können. Behoben: Der Verlauf ist auf der Speicherebene nach Unternehmen geschlüsselt, mit einem Test, der fehlschlägt, falls der alte Schlüssel zurückkehrt. Es wurde durch das Audit gefunden, nicht von einem Kunden gemeldet.

HIGH Ein Provider, der einen Aufrufer auslaugt

In der mandantenübergreifenden Tool-Ökonomie konnte ein Anbieter den Preis eines gewährten Tools erhöhen, nachdem ein Aufrufer begonnen hatte, es zu nutzen, und so dessen Guthaben leeren. Behoben: Der Aufrufer stimmt einem Preis pro Aufruf zu, fail-closed, keine Zustimmung, keine Belastung, durchgesetzt, bevor sich auch nur ein Credit bewegt.

HIGH Krise hinter dem Metering

Die Abrechnungsprüfung lief vor der Krisenprüfung, sodass ein Kunde in Not, der einem Unternehmen ohne Guthaben schrieb, „nicht verfügbar“ statt einer Krisen-Hotline bekam. Behoben: Krisenhilfe wird kostenlos bereitgestellt, vor jedem Limit und jeder Belastung, auf jeder Kundenoberfläche.

Die Blickwinkel umfassen Isolation · Auth · Injection · Geld · Governance · Buchung · Kanäle · den autonomen Resident · Betroffenenrechte (GDPR/PECR) · den Site-Generator · Frontend · Ops. Das Urteil, in jeder Runde: null kritische Befunde offen; Mandantenisolation und XSS-Angriffsfläche ohne Befund; kein aktiver Auth-Bypass: Jede bestätigte Randlücke wurde behoben und neu deployt.

die ehrlichen Zahlen

Jede Zahl, mit bereits angehängtem Sternchen.

Die meisten Entwickler tragen dick auf. Mir ist lieber, Sie vertrauen den Teilen, die echt sind, als dass Sie von Teilen beeindruckt sind, die es nicht sind.

1Builder* kein Team
3,389bestandene Tests* CI, 2026-10-01, kein formaler Beweis
6 → 0Audits · offene kritische Befunde* selbst durchgeführt, nicht durch Dritte; null kritische Befunde, Stand 2026-09-25, Kernpaket
0bekannte mandantenübergreifende Sicherheitsverletzungen in Produktion* keine gemeldet; ein Leck im Audit gefunden und behoben, siehe unten
1Produktionsinstanz* bewusst so, Skalierung ist noch nicht die Lektion

Das System ist ehrlich, weil die Person, die es entworfen hat, ehrlich ist. Dafür habe ich von Anfang an gesorgt: eingebaut, nicht nachträglich angeschraubt.

die Einladung

Die Zahlen halten. Sternchen inklusive.

Wenn Sie einen Entwickler suchen, der seine eigene Arbeit so hart angreift, bevor jemand danach fragt, und das weiter tut, während das System wächst, lassen Sie uns reden.