Published by Capital Insight Ltd · Nicosia Herausgegeben von Capital Insight Ltd · Nikosia
The Banking Dossier
Regulation

The red team got in 469 times. The self-assessment beat its target.

Das Angriffsteam kam 469-mal durch. Die Selbsteinschätzung übertraf ihr Ziel.

Two numbers sit in the same document and point in opposite directions. In thirteen threat-led penetration tests run during 2025 on the live systems of British banks, insurers, asset managers and market infrastructures, the attacking teams recorded 469 successful tactics. The same exercise asked those firms to score their own threat-intelligence capability against their own targets, and, in the words of the report, the self-assessed scores “not only met but surpassed their targets” in every domain. Both figures come from the 2025 CBEST thematic, published jointly by the Bank of England, the Prudential Regulation Authority and the Financial Conduct Authority. Only one of them was produced by someone actually trying to get in.

Two numbers, one report

CBEST is the United Kingdom’s regulatory framework for threat-led penetration testing: a red team, briefed by threat-intelligence providers on what a plausible attacker would actually do, attacks the firm’s real production estate while almost nobody inside the firm knows it is a test. The regulators have run it for over a decade — the 2024 edition of the same annual report noted the programme’s tenth anniversary. Each year the three authorities publish a thematic summary so that firms which were not tested can read what happened to those which were.

The 2025 edition, whose page the Bank of England last updated on 20 January 2026, sets out what the testers found across five areas. Configurations were inconsistent and systems unpatched. Passwords were weak, sometimes stored in plain text, and privileged accounts were insufficiently restricted. Networks were flat, with development and production environments not properly separated. Monitoring and alerting were poorly tuned, so early-stage intrusions and data exfiltration went unseen. And staff — the report is blunt about this — fell for social engineering, left credentials in spreadsheets and open file shares, and worked at help desks whose procedures let an attacker reset someone else’s authentication.

None of that is exotic. It is the foundational layer, and the regulators say so: the report describes the gaps as “some of them foundational”. Against that, the second number. CBEST includes a Threat Intelligence Maturity Assessment, a scoring toolkit published by CREST, an accreditation body for the security testing industry. It rates four domains: governance, programme planning and requirements, threat-intelligence operations, and functional management. In 2025 the participating firms scored themselves above target in all four. The weakest domain, programme planning, still exceeded its target.

The same instrument said something else a year earlier

The 2024 CBEST thematic, published by the same three authorities on 13 December 2024, used the same CREST toolkit and reported the opposite. Firms and infrastructures “displayed weaknesses in their threat intelligence operations”. Threat intelligence “was not well integrated”, with the lowest scores in programme planning and requirements — and in operations. Twelve months later, operations is the self-identified strongest domain.

Two things follow, and they are not the same thing. The first is that a genuine improvement in one year across an entire industry is a strong claim, and the report does not make it: it does not compare the two years, and it does not say the cohorts overlap. Different firms are tested each year. The second is more interesting. The 2025 report uses the word “self-assessed” three times in four sentences. The 2024 report does not use it at all. Whether the scoring changed, or only the labelling of it, the reader of the earlier report had no way to know that the maturity numbers were the firm’s own view of itself, while the technical findings beside them were an outsider’s.

That distinction is the whole subject. A supervisory regime generates numbers of two kinds: those obtained by observing, and those obtained by asking. They are not interchangeable, they are not equally expensive, and only one of them scales.

The euro area exercise has the same shape

In 2024 the European Central Bank ran its first cyber resilience stress test on the banks it directly supervises. The design is worth reading closely, because the ECB published it in unusual detail. The scenario assumed that every preventive control had failed and that an attack had corrupted the databases underneath each bank’s core systems. The question was not whether the bank could keep an attacker out. It was whether the bank could come back.

The ECB tested 109 banks — out of 113 under its direct supervision at the time, with a handful excluded for restructuring or a change of significance status. But the exercise had two tiers, and the ECB’s own frequently-asked-questions page sets out the difference. Eighty-one banks were in the standard assessment: they answered a questionnaire and supplied evidence — internal ICT policies and procedures, past incident notifications, and the results of previous IT recovery tests run against a similar scenario. Twenty-eight banks were in the enhanced assessment: on top of all of that, they had to perform an actual IT recovery test against the 2024 scenario, produce evidence that it had succeeded, and receive supervisors on site for quality assurance.

So of the 109 banks in Europe’s first cyber recovery stress test, 28 recovered something. That is 25.7 per cent. The other 74.3 per cent demonstrated recovery on paper, partly by submitting the results of recovery tests they had run for their own purposes at some earlier date. The ECB is explicit that the sample of 28 was chosen to span business models and countries, not by cyber risk profile — it was built for representativeness, not for targeting. And the ECB is equally explicit about the weight of the result: the exercise was “predominantly qualitative”, it fed into the 2024 Supervisory Review and Evaluation Process, and it did not touch Pillar 2 Guidance. No capital moved.

What the ECB said afterwards is worth parsing for what it implies. Banks, the supervisor wrote, “should also be able to meet their own recovery objectives, properly assess dependencies on critical third-party ICT service providers, and adequately estimate direct and indirect losses from a cyberattack”. Every clause there is a diagnosis in the negative. A supervisor does not tell an industry to be able to meet its own recovery objectives unless some part of that industry, when asked to demonstrate it, did not. The formulation is careful — no bank is named, no proportion is given, and the reader cannot tell whether the shortfall showed up in the 28 that recovered or in the 81 that described recovering. That ambiguity is the price of an exercise with no published distribution.

There is also a structural gap that neither exercise closes, and it becomes visible only when the two are laid side by side. The ECB’s scenario begins after prevention has failed; the FAQ says so explicitly, and the press release repeats it. CBEST, by contrast, ends before recovery begins: the red team demonstrates that it got in and that nobody noticed, and the report’s five areas are about protection, detection and response. So Europe’s broadest cyber exercise deliberately declines to test whether attacks can be stopped, and its most rigorous one declines to test whether a corrupted core banking database can be restored. Each is defensible alone. Together they leave the middle of the chain — detection failing, then recovery being attempted for real, under an adversary who is still inside — untested by anyone.

What the law asks for

The Digital Operational Resilience Act has applied across the European Union since 17 January 2025, and it splits testing along exactly the same seam. Article 24 requires every financial entity in scope, other than microenterprises, to maintain a testing programme and to test all ICT systems supporting critical or important functions at least once a year. Article 25 lists what may count: vulnerability assessments and scans, open-source analysis, network security assessments, gap analyses, physical security reviews, source code review where feasible, scenario-based tests, performance and end-to-end testing, penetration testing — and questionnaires. A questionnaire and a penetration test sit in the same list, discharging the same annual obligation.

Articles 26 and 27 are the other kind. Threat-led penetration testing must be carried out at least every three years, on live production systems, covering several critical or important functions, by testers who are certified, demonstrably expert and carry professional indemnity insurance. It is not required of everyone: Article 26 leaves national competent authorities to designate the entities significant enough to face it. In February 2025 the Eurosystem realigned TIBER-EU — the framework central banks had used for voluntary red-teaming since 2018 — with the DORA technical standards, so that a TIBER test can discharge the legal obligation. The framework renamed the internal group that runs the test from White Team to Control Team, which is a small thing, and made the whole exercise mandatory for the designated, which is not.

How many entities are designated is a number I could not find published by the European Supervisory Authorities or by the ECB in the course of this research. Estimates in circulation — a few hundred across the Union — come from firms that sell the tests. So do the cost figures: vendors’ published guides put a first cycle somewhere between roughly €200,000 and €620,000, and describe accredited providers as booked twelve to eighteen months ahead. The range is wide enough to be an admission rather than a measurement, and everyone quoting it has an interest in the number being large. But no supervisor has published a competing figure, which is itself part of the picture.

The case for the design as it stands

The argument for building it this way is strong, and it is worth putting properly before disagreeing with any of it.

Threat-led penetration testing is dangerous. It runs against the live production estate of a systemically important institution, with real payment systems attached, while the defenders believe the intrusion is genuine. Every hour of it is a controlled risk that a supervisor has to be willing to own. It is also scarce: the pool of teams that can combine threat intelligence, disciplined scoping, safe execution on production and the regulatory paperwork is small, and it does not grow because a regulation says it should. A rule requiring 5,000 entities to be red-teamed annually would not produce 5,000 red team tests; it would produce a shortage, a race to the cheapest accreditation, and tests designed to be survivable rather than informative.

The Bank of England has itself acted on that arithmetic. Alongside CBEST it introduced STAR-FS in 2024 — Simulated Targeted Attack and Response for the Finance Sector — described in the 2025 thematic as a complementary framework extending threat-led testing to a wider range of firms and infrastructures, and whose broader adoption the regulators say they encourage. That is a supervisor conceding that thirteen assessments a year is not coverage, and building a second, lighter channel rather than pretending the first reaches further than it does. Naming the limit is better practice than most of what surrounds it.

Against that, a questionnaire sent to 109 banks produces something the thirteen-test programme cannot: comparability. Supervisors could see the same twenty questions answered by every significant institution in the euro area, and could tell which answers were outliers. That is a legitimate supervisory product. The ECB gave each bank an individual report with recommendations, to be followed up by its Joint Supervisory Team — the exercise was not scored, but it was not inert either.

And there is a deeper version of the argument, made by central bankers themselves. In the ECB’s Macroprudential Bulletin of March 2025, staff from the ECB, De Nederlandsche Bank, the Banque de France, the Banco de Portugal, the Banque centrale du Luxembourg and Suomen Pankki wrote that cyber risk “can be non-monetary in nature and is difficult to quantify in a stress-test setting”, and that “instead of trying to map a cyber incident onto a macroeconomic scenario and a financial loss, other techniques such as intelligence-led red team exercises might be better suited to revealing significant vulnerabilities”. Read plainly, that is a group of supervisors saying the scenario exercise should not be mistaken for the measuring instrument — and that the red team is the measuring instrument. The design is not naive. It is a deliberate division of labour between an instrument that covers everyone approximately and an instrument that covers a few precisely.

What 469 is, and what it is not

The measured number deserves the same scepticism as the self-scored one. Four hundred and sixty-nine successful tactics, mapped to the MITRE ATT&CK catalogue, is a count of technique instances across thirteen engagements — roughly thirty-six per engagement. It is not a severity measure. A successful reconnaissance step and a successful compromise of a domain administrator both count as one. There is no denominator: the report does not say how many attempted tactics failed, so the figure cannot be turned into a hit rate. And “successful” is judged by the tester, who was hired to find things and whose next contract depends on having found them. The Bank of England is alert to at least the last risk — the 2025 report tells firms to rotate providers between assessments and says regulators will scrutinise cases where rotation did not happen.

What the number does carry is a shape. The same five foundational areas failed in 2025 as in 2024: identity and access, configuration and patching, network segmentation, detection and response, and staff behaviour. Two consecutive years of adversarial testing found the same class of gap. That is a more durable finding than any single count.

Where the incentive sits

Consider who computes each number and what happens to them afterwards.

A red team finding arrives with an owner, a technical description, a MITRE reference and a place in a remediation plan that the regulator will ask about. The 2025 report devotes a whole section to that plan, and what it says about it is telling: remediation should be planned around “risk-reduction milestones (not only on delivering specific technical activities)”, and should include “assessment of their operational effectiveness, and reduction of exposure”. Translated: the regulators have watched firms close findings without reducing risk, and have written that observation down.

A self-assessed maturity score arrives with none of that. The firm sets the target, the firm scores itself against it, and nobody with an interest in a lower number is in a position to compute one. This is the same structural problem that appears wherever a supervisory obligation is discharged by attestation rather than observation. It is why the administrators of failed electronic money firms kept finding that the safeguarding records looked orderly until somebody outside the firm tried to reconcile them. It is why an interface can be compliant for years and useless in practice, and why European open banking needed a performance standard written into law before anyone measured what the interfaces actually did. The failure mode is not dishonesty. It is that an unobserved number drifts toward the answer its author would prefer, slowly, without anyone deciding to lie.

How confident to be

Firmly: the two-tier structure is real and documented by the authorities themselves — 81 questionnaire banks against 28 recovery-testing banks at the ECB; thirteen adversarial assessments in the United Kingdom in 2025 alongside self-scored maturity across the same cohort; questionnaires and penetration tests listed side by side in Article 25 of DORA.

With reasonable confidence: the self-assessed maturity scores are worth less as evidence than the technical findings printed next to them, because they are produced by the party being assessed, against a target that party set.

Cautiously: that the 2024-to-2025 movement in the threat-intelligence scores reflects labelling or optimism rather than improvement. It may be a real improvement. Different firms were tested, and neither report claims a trend.

What this does not tell you

It does not tell you that the 81 standard-assessment banks cannot recover. Many of them supplied results from recovery tests they had genuinely run; the ECB asked for exactly that evidence. The finding is about what the supervisor watched happen, not about what the bank can do.

It does not tell you that CBEST findings are representative of the sector. Thirteen assessments, at institutions selected for systemic importance, are not a sample of British finance. The recurrence of the same five areas across two years is suggestive; it is not a prevalence estimate.

And it does not tell you what any of this costs, or whether more adversarial testing would be worth the money. Nobody with the authority to publish that figure has published it. The cost estimates that exist come from the sellers.

The general shape

Every supervisory framework eventually has to choose between reach and evidence, and the choice is usually made silently. Reach is cheap: a questionnaire covers everyone, produces comparable rows, and can be repeated annually without risk. Evidence is expensive: it requires someone outside the firm to attempt the thing in question, on the real system, with a real chance of failure. Because the cheap instrument scales and the expensive one does not, the cheap instrument ends up carrying most of the regime, and its output ends up in the same report, in the same typeface, as the output of the expensive one.

The remedy is not to abandon the questionnaire. It is to label it — every time, in the way the 2025 CBEST thematic does and the 2024 edition did not — and to keep at least one instrument in the regime that cannot be answered, only survived. Payment supervision has the same seam running through it in other places: an outage reaches the supervisor on a deadline measured in hours while it reaches the customer when someone decides, because one of those two obligations has a number attached and the other does not. The pattern is always the same. What gets counted is what someone was made to demonstrate. Everything else is a firm’s account of itself, and it should be read that way.

In derselben Veröffentlichung stehen zwei Zahlen, die in entgegengesetzte Richtungen zeigen. Bei dreizehn bedrohungsgeleiteten Penetrationstests, die 2025 auf den laufenden Produktivsystemen britischer Banken, Versicherer, Vermögensverwalter und Marktinfrastrukturen durchgeführt wurden, verzeichneten die angreifenden Teams 469 erfolgreiche Taktiken. Dieselben Häuser bewerteten im selben Verfahren ihre eigene Fähigkeit zur Bedrohungsaufklärung gegen selbst gesetzte Ziele — und die selbst vergebenen Werte haben, so der Bericht wörtlich, ihre Ziele in jedem Bereich nicht nur erreicht, sondern übertroffen. Beide Zahlen stammen aus dem CBEST-Themenbericht 2025, gemeinsam herausgegeben von der Bank of England, der Prudential Regulation Authority und der Financial Conduct Authority. Nur eine davon hat jemand erzeugt, der tatsächlich versucht hat hineinzukommen.

Zwei Zahlen, ein Bericht

CBEST ist der britische Aufsichtsrahmen für bedrohungsgeleitete Penetrationstests. Ein Angriffsteam, das von Aufklärungsdienstleistern damit gebrieft wird, was ein realistischer Angreifer tatsächlich täte, greift die echte Produktionslandschaft des Hauses an — während fast niemand im Haus weiß, dass es sich um eine Prüfung handelt. Die Aufsicht betreibt das seit über zehn Jahren; die Ausgabe 2024 desselben Jahresberichts vermerkte das zehnjährige Bestehen des Programms. Jedes Jahr veröffentlichen die drei Behörden eine thematische Auswertung, damit auch die nicht geprüften Häuser lesen können, was den geprüften widerfahren ist.

Die Ausgabe 2025, deren Seite die Bank of England zuletzt am 20. Januar 2026 aktualisiert hat, benennt die Befunde in fünf Bereichen. Konfigurationen waren uneinheitlich, Systeme ungepatcht. Kennwörter waren schwach, teils im Klartext abgelegt, privilegierte Konten unzureichend eingeschränkt. Netze waren flach, Entwicklungs- und Produktivumgebungen nicht sauber getrennt. Überwachung und Alarmierung waren schlecht abgestimmt, sodass frühe Eindringversuche und der Abfluss von Daten unbemerkt blieben. Und die Mitarbeitenden — hier wird der Bericht ausgesprochen deutlich — fielen auf Täuschungsversuche herein, hinterließen Zugangsdaten in Tabellenblättern und offenen Dateiablagen und arbeiteten an Servicetheken, deren Abläufe es einem Angreifer erlaubten, die Anmeldedaten fremder Personen zurücksetzen zu lassen.

Nichts davon ist exotisch. Es ist die Grundschicht, und die Aufsicht sagt das auch: Der Bericht nennt die beobachteten Lücken ausdrücklich zum Teil grundlegend. Dagegen steht die zweite Zahl. Zu CBEST gehört eine Reifegradbewertung der Bedrohungsaufklärung, ein Bewertungswerkzeug der Akkreditierungsstelle CREST, die selbst die Prüfbranche zertifiziert. Es bewertet vier Bereiche: Steuerung, Programmplanung und Anforderungen, den laufenden Betrieb der Bedrohungsaufklärung sowie die Führung der Funktion. 2025 bewerteten sich die teilnehmenden Häuser in allen vier Bereichen über Ziel. Selbst der schwächste Bereich, die Programmplanung, lag noch über seiner Vorgabe.

Dasselbe Instrument sagte ein Jahr zuvor etwas anderes

Der CBEST-Themenbericht 2024, herausgegeben von denselben drei Behörden am 13. Dezember 2024, benutzte dasselbe CREST-Werkzeug und meldete das Gegenteil. Die Häuser und Infrastrukturen zeigten, so der damalige Wortlaut, Schwächen im Betrieb ihrer Bedrohungsaufklärung. Die Aufklärung sei nicht gut in das Haus eingebunden gewesen, mit den niedrigsten Werten bei der Programmplanung — und im Betrieb. Zwölf Monate später ist der Betrieb der selbst benannte stärkste Bereich.

Daraus folgen zwei Dinge, und sie sind nicht dasselbe. Erstens ist eine echte Verbesserung einer ganzen Branche binnen eines Jahres eine starke Behauptung, und der Bericht stellt sie nicht auf: Er vergleicht die beiden Jahre nicht und behauptet auch nicht, dass es dieselben Häuser waren. Geprüft wird jedes Jahr ein anderer Kreis. Zweitens, und das ist der interessantere Punkt: Der Bericht 2025 verwendet das Wort „selbst bewertet” dreimal in vier Sätzen. Der Bericht 2024 verwendet es kein einziges Mal. Ob sich die Bewertung geändert hat oder nur ihre Beschriftung — wer den früheren Bericht las, konnte nicht erkennen, dass die Reifegradzahlen die Sicht des Hauses auf sich selbst waren, während die technischen Befunde daneben von außen kamen.

Genau diese Unterscheidung ist das Thema. Ein Aufsichtsregime erzeugt Zahlen zweier Arten: solche, die durch Beobachten entstehen, und solche, die durch Fragen entstehen. Sie sind nicht austauschbar, sie kosten nicht dasselbe, und nur eine von beiden lässt sich in die Breite tragen.

Die europäische Übung hat dieselbe Bauform

2024 führte die Europäische Zentralbank ihren ersten Stresstest zur Cyber-Widerstandsfähigkeit bei den von ihr unmittelbar beaufsichtigten Banken durch. Der Aufbau lohnt genaues Lesen, weil die EZB ihn ungewöhnlich offen dokumentiert hat. Das Szenario unterstellte, dass sämtliche vorbeugenden Maßnahmen versagt hatten und ein Angriff die Datenbanken unter den Kernsystemen jedes Hauses beschädigt hatte. Die Frage war nicht, ob die Bank einen Angreifer draußen halten kann. Die Frage war, ob sie zurückkommt.

Die EZB prüfte 109 Banken — von 113 damals unmittelbar beaufsichtigten, wobei einige wegen Umstrukturierung oder geänderter Einstufung ausgenommen waren. Die Übung hatte allerdings zwei Stufen, und die EZB legt den Unterschied in ihrem eigenen Fragen-und-Antworten-Papier offen. 81 Banken durchliefen die Standardstufe: Sie beantworteten einen Fragebogen und reichten Nachweise ein — interne Regelwerke und Verfahren zum IKT-Risiko, frühere Meldungen von Cyber-Vorfällen sowie die Ergebnisse früherer IT-Wiederherstellungstests mit einem ähnlichen Szenario. 28 Banken durchliefen die erweiterte Stufe: Sie mussten zusätzlich einen tatsächlichen IT-Wiederherstellungstest zum Szenario von 2024 durchführen, den Erfolg belegen und für die Qualitätssicherung eine Vor-Ort-Prüfung über sich ergehen lassen.

Von 109 Banken im ersten europäischen Wiederherstellungs-Stresstest haben also 28 tatsächlich etwas wiederhergestellt. Das sind 25,7 Prozent. Die übrigen 74,3 Prozent haben die Wiederherstellung auf dem Papier belegt, teilweise mit den Ergebnissen von Tests, die sie zu einem früheren Zeitpunkt für eigene Zwecke gefahren hatten. Die EZB sagt ausdrücklich, dass die 28 nach Geschäftsmodell und Land ausgewählt wurden, nicht nach Risikoprofil — die Stichprobe war auf Repräsentativität gebaut, nicht auf Treffsicherheit. Und die EZB ist ebenso deutlich beim Gewicht des Ergebnisses: Die Übung war überwiegend qualitativ, floss in den aufsichtlichen Überprüfungs- und Bewertungsprozess 2024 ein und ließ die Säule-2-Empfehlung unberührt. Es bewegte sich kein Kapital.

Was die EZB anschließend schrieb, lohnt eine Lektüre auf das hin, was es unterstellt. Banken sollten, so die Aufsicht, in der Lage sein, ihre eigenen Wiederherstellungsziele einzuhalten, ihre Abhängigkeiten von kritischen IKT-Drittanbietern sachgerecht zu bewerten und die unmittelbaren wie mittelbaren Schäden eines Angriffs angemessen zu schätzen. Jeder dieser Halbsätze ist eine Diagnose in der Verneinung. Eine Aufsicht fordert eine Branche nicht auf, ihre eigenen Wiederherstellungsziele einhalten zu können, wenn nicht ein Teil dieser Branche das auf Nachfrage nicht konnte. Die Formulierung ist vorsichtig: Kein Haus wird genannt, kein Anteil beziffert, und der Leser kann nicht erkennen, ob der Mangel bei den 28 auftrat, die wirklich wiederherstellten, oder bei den 81, die es beschrieben. Diese Unschärfe ist der Preis einer Übung, deren Verteilung nicht veröffentlicht wird.

Es gibt außerdem eine bauliche Lücke, die keine der beiden Übungen schließt, und sie wird erst sichtbar, wenn man sie nebeneinanderlegt. Das Szenario der EZB beginnt, nachdem die Vorbeugung versagt hat; das Frage-und-Antwort-Papier sagt es ausdrücklich, die Pressemitteilung wiederholt es. CBEST hingegen endet, bevor die Wiederherstellung beginnt: Das Angriffsteam weist nach, dass es hineinkam und dass es niemand bemerkte, und die fünf Bereiche des Berichts betreffen Schutz, Erkennung und Reaktion. Europas breiteste Cyber-Übung verzichtet also bewusst darauf zu prüfen, ob Angriffe aufzuhalten sind, und die gründlichste verzichtet darauf zu prüfen, ob sich eine beschädigte Kernbankdatenbank zurückholen lässt. Jede für sich ist vertretbar. Zusammen lassen sie die Mitte der Kette ungeprüft — Erkennung, die versagt, und danach eine Wiederherstellung, die ernsthaft versucht wird, während der Angreifer noch im Haus ist.

Was das Gesetz verlangt

Die europäische Verordnung über die digitale operationale Widerstandsfähigkeit gilt seit dem 17. Januar 2025, und sie trennt das Prüfen an genau derselben Naht. Artikel 24 verpflichtet jedes erfasste Unternehmen außer Kleinstunternehmen, ein Prüfprogramm zu unterhalten und alle IKT-Systeme, die kritische oder wichtige Funktionen tragen, mindestens jährlich zu prüfen. Artikel 25 listet auf, was dafür zählen darf: Schwachstellenbewertungen und -scans, Auswertung offener Quellen, Netzsicherheitsbewertungen, Lückenanalysen, Prüfungen der physischen Sicherheit, Quellcodeprüfungen soweit machbar, szenariobasierte Tests, Leistungs- und Ende-zu-Ende-Tests, Penetrationstests — und Fragebögen. Fragebogen und Penetrationstest stehen in derselben Liste und erfüllen dieselbe Jahrespflicht.

Die Artikel 26 und 27 sind die andere Sorte. Bedrohungsgeleitete Penetrationstests sind mindestens alle drei Jahre durchzuführen, auf laufenden Produktivsystemen, über mehrere kritische oder wichtige Funktionen hinweg, durch Prüfer, die zertifiziert und nachweislich fachkundig sind und eine Berufshaftpflichtversicherung tragen. Verlangt wird das nicht von allen: Artikel 26 überlässt es den zuständigen nationalen Behörden, die Unternehmen zu benennen, die bedeutend genug dafür sind. Im Februar 2025 hat das Eurosystem den Rahmen TIBER-EU — den die Zentralbanken seit 2018 für freiwillige Angriffssimulationen nutzten — auf die technischen Regulierungsstandards der Verordnung ausgerichtet, sodass ein TIBER-Test die gesetzliche Pflicht erfüllen kann. Der Rahmen benannte dabei das interne Steuerungsteam von White Team in Control Team um, was eine Kleinigkeit ist, und machte die ganze Übung für die Benannten verbindlich, was keine ist.

Wie viele Unternehmen benannt sind, ist eine Zahl, die ich im Lauf dieser Recherche weder bei den europäischen Aufsichtsbehörden noch bei der EZB veröffentlicht gefunden habe. Die kursierenden Schätzungen — einige hundert unionsweit — stammen von Häusern, die diese Tests verkaufen. Ebenso die Kostenangaben: Veröffentlichte Leitfäden von Anbietern setzen einen ersten Zyklus zwischen rund 200.000 und 620.000 Euro an und beschreiben akkreditierte Anbieter als zwölf bis achtzehn Monate im Voraus ausgebucht. Die Spanne ist weit genug, um ein Eingeständnis zu sein statt einer Messung, und jeder, der sie nennt, hat ein Interesse daran, dass die Zahl groß ist. Nur hat keine Aufsicht eine Gegenzahl veröffentlicht, und auch das gehört zum Bild.

Was für den Aufbau spricht, wie er ist

Das Argument dafür, es so zu bauen, ist stark, und es gehört ordentlich vorgetragen, bevor man ihm widerspricht.

Bedrohungsgeleitetes Testen ist gefährlich. Es läuft gegen die laufende Produktionslandschaft eines systemisch bedeutenden Hauses, mit echten Zahlungssystemen daran, während die Verteidiger den Einbruch für echt halten. Jede Stunde davon ist ein beherrschtes Risiko, das eine Aufsicht bereit sein muss zu tragen. Es ist zudem knapp: Der Kreis der Teams, die Bedrohungsaufklärung, diszipliniertes Abgrenzen, sicheres Vorgehen im Produktivbetrieb und die aufsichtliche Papierarbeit zugleich beherrschen, ist klein, und er wächst nicht dadurch, dass eine Verordnung es verlangt. Eine Regel, die 5.000 Unternehmen jährlich einem Angriffsteam aussetzt, erzeugt keine 5.000 Angriffssimulationen; sie erzeugt Knappheit, einen Wettlauf um die billigste Akkreditierung und Tests, die darauf ausgelegt sind, überstanden zu werden statt etwas zu zeigen.

Die Bank of England hat aus dieser Rechnung selbst Folgen gezogen. Neben CBEST hat sie 2024 STAR-FS eingeführt, im Bericht 2025 beschrieben als ergänzender Rahmen, der bedrohungsgeleitetes Testen auf einen weiteren Kreis von Häusern und Infrastrukturen ausdehnt und dessen breitere Nutzung die Aufsicht ausdrücklich befürwortet. Das ist eine Aufsicht, die einräumt, dass dreizehn Prüfungen im Jahr keine Abdeckung sind, und die einen zweiten, leichteren Kanal baut, statt so zu tun, als reiche der erste weiter als er reicht. Die Grenze zu benennen ist bessere Praxis als vieles, was daneben steht.

Dem steht gegenüber, dass ein Fragebogen an 109 Banken etwas erzeugt, was das Dreizehn-Test-Programm nicht kann: Vergleichbarkeit. Die Aufsicht konnte dieselben Fragen von jedem bedeutenden Institut des Euroraums beantwortet sehen und erkennen, welche Antworten aus der Reihe fielen. Das ist ein legitimes aufsichtliches Erzeugnis. Jede Bank erhielt einen eigenen Bericht mit Empfehlungen, dem die gemeinsamen Aufsichtsteams nachgehen — bewertet wurde die Übung nicht, folgenlos war sie deshalb nicht.

Und es gibt eine tiefere Fassung des Arguments, vorgetragen von Zentralbankleuten selbst. Im Makroprudenziellen Bulletin der EZB vom März 2025 schrieben Mitarbeitende der EZB, von De Nederlandsche Bank, der Banque de France, der Banco de Portugal, der Banque centrale du Luxembourg und der Suomen Pankki, Cyberrisiko könne nichtmonetärer Natur und in einem Stresstest schwer zu quantifizieren sein; statt einen Cyber-Vorfall auf ein Makroszenario und einen finanziellen Verlust abzubilden, seien andere Techniken wie aufklärungsgeleitete Angriffssimulationen möglicherweise besser geeignet, erhebliche Schwachstellen sichtbar zu machen. Im Klartext sagt hier eine Gruppe von Aufsehern, dass die Szenarioübung nicht mit dem Messinstrument verwechselt werden darf — und dass das Angriffsteam das Messinstrument ist. Der Aufbau ist nicht naiv. Er ist eine bewusste Arbeitsteilung zwischen einem Instrument, das alle ungefähr erfasst, und einem, das wenige genau erfasst.

Was 469 ist und was nicht

Die gemessene Zahl verdient dieselbe Skepsis wie die selbst vergebene. 469 erfolgreiche Taktiken, zugeordnet zum MITRE-ATT&CK-Katalog, ist eine Zählung einzelner Technikanwendungen über dreizehn Einsätze — rund sechsunddreißig je Einsatz. Es ist kein Maß für Schwere. Ein gelungener Aufklärungsschritt und die gelungene Übernahme eines Domänenadministrators zählen beide als eins. Es gibt keinen Nenner: Der Bericht sagt nicht, wie viele Versuche scheiterten, die Zahl lässt sich also nicht in eine Trefferquote verwandeln. Und was „erfolgreich” heißt, entscheidet das Prüfteam, das dafür bezahlt wurde, etwas zu finden, und dessen nächster Auftrag davon abhängt, dass es etwas gefunden hat. Zumindest die letzte Gefahr sieht die Bank of England: Der Bericht 2025 fordert die Häuser auf, zwischen zwei Prüfungen den Anbieter zu wechseln, und kündigt an, Fälle ohne Wechsel genauer anzusehen.

Was die Zahl dagegen trägt, ist eine Form. 2025 versagten dieselben fünf Grundbereiche wie 2024: Identitäten und Zugriffe, Konfiguration und Aktualisierung, Netztrennung, Erkennung und Reaktion sowie das Verhalten der Belegschaft. Zwei aufeinanderfolgende Jahre gegnerischen Prüfens fanden dieselbe Klasse von Lücke. Das ist ein haltbarerer Befund als jede einzelne Zählung.

Eine zweite Form steckt darin, welche Angreifer die Aufklärungsdienstleister 2025 für plausibel hielten und die Teams deshalb nachstellten: hochbefähigte staatliche Akteure, organisierte kriminelle Gruppen und böswillige Innentäter. Die am häufigsten gewählten Angriffswege waren dabei nicht die spektakulären, sondern die drei, die der Bericht als anhaltende und systemische Risiken beschreibt: die Übernahme eines Zulieferers, die Täuschung von Menschen und der Missbrauch berechtigten Zugangs von innen. Alle drei umgehen die Grenze des Hauses, statt sie zu durchbrechen — und alle drei landen genau in den fünf Grundbereichen, in denen die Prüfungen zwei Jahre hintereinander fündig wurden.

Wo der Anreiz sitzt

Man betrachte, wer welche Zahl erzeugt und was danach mit ihr geschieht.

Ein Befund des Angriffsteams kommt mit einem Verantwortlichen, einer technischen Beschreibung, einer Katalogreferenz und einem Platz in einem Behebungsplan, nach dem die Aufsicht fragen wird. Der Bericht 2025 widmet diesem Plan einen eigenen Abschnitt, und was dort steht, ist aufschlussreich: Die Behebung solle an Meilensteinen der Risikominderung ausgerichtet werden und nicht allein daran, technische Tätigkeiten abzuliefern; sie solle die betriebliche Wirksamkeit und die tatsächliche Verringerung der Angriffsfläche prüfen. Übersetzt: Die Aufsicht hat Häuser dabei beobachtet, wie sie Befunde schlossen, ohne das Risiko zu senken, und hat diese Beobachtung aufgeschrieben.

Eine selbst vergebene Reifegradzahl kommt mit nichts davon. Das Haus setzt das Ziel, das Haus bewertet sich dagegen, und niemand mit einem Interesse an einer niedrigeren Zahl ist in der Lage, eine auszurechnen. Das ist dasselbe bauliche Problem, das überall dort auftaucht, wo eine aufsichtliche Pflicht durch Erklärung statt durch Beobachtung erfüllt wird. Es ist der Grund, warum die Verwalter gescheiterter E-Geld-Häuser immer wieder feststellten, dass die Sicherungsunterlagen ordentlich aussahen, bis jemand von außen sie tatsächlich abstimmte. Es ist der Grund, warum eine Schnittstelle jahrelang regelkonform und zugleich unbrauchbar sein kann und warum das europäische Open Banking erst einen Leistungsmaßstab im Gesetz brauchte, bevor überhaupt jemand maß, was die Schnittstellen leisteten. Der Fehler ist nicht Unehrlichkeit. Es ist, dass eine unbeobachtete Zahl langsam auf die Antwort zuwandert, die ihr Verfasser bevorzugt, ohne dass jemand sich entschieden hätte zu lügen.

Wie sicher man sein kann

Fest vertreten: Die Zweiteilung ist real und von den Behörden selbst belegt — 81 Fragebogen-Banken gegen 28 wiederherstellende Banken bei der EZB; dreizehn gegnerische Prüfungen im Vereinigten Königreich im Jahr 2025 neben selbst vergebenen Reifegraden desselben Kreises; Fragebögen und Penetrationstests nebeneinander in Artikel 25 der Verordnung.

Mit vernünftiger Sicherheit: Die selbst vergebenen Reifegrade sind als Beleg weniger wert als die technischen Befunde daneben, weil sie von der bewerteten Partei gegen ein von ihr selbst gesetztes Ziel erzeugt wurden.

Vorsichtig: dass die Bewegung der Aufklärungswerte von 2024 auf 2025 eher Beschriftung oder Zuversicht abbildet als Verbesserung. Es kann eine echte Verbesserung sein. Es waren andere Häuser, und keiner der beiden Berichte behauptet einen Trend.

Was daraus nicht folgt

Es folgt nicht, dass die 81 Banken der Standardstufe sich nicht wiederherstellen können. Viele von ihnen haben Ergebnisse aus Tests eingereicht, die sie wirklich gefahren hatten; genau diesen Nachweis hat die EZB verlangt. Der Befund betrifft, was die Aufsicht geschehen sah, nicht was die Bank kann.

Es folgt nicht, dass die CBEST-Befunde für den Markt repräsentativ sind. Dreizehn Prüfungen bei Häusern, die wegen ihrer systemischen Bedeutung ausgewählt wurden, sind keine Stichprobe des britischen Finanzwesens. Dass dieselben fünf Bereiche zweimal auftauchen, ist ein Hinweis; eine Verbreitungsschätzung ist es nicht.

Und es folgt nichts darüber, was das alles kostet oder ob mehr gegnerisches Prüfen das Geld wert wäre. Niemand, der befugt wäre, diese Zahl zu veröffentlichen, hat sie veröffentlicht. Die vorhandenen Kostenschätzungen stammen von den Verkäufern.

Die allgemeine Form

Jedes Aufsichtsregime muss irgendwann zwischen Reichweite und Beleg wählen, und die Wahl fällt meist stillschweigend. Reichweite ist billig: Ein Fragebogen erfasst alle, erzeugt vergleichbare Zeilen und lässt sich jährlich ohne Risiko wiederholen. Beleg ist teuer: Er verlangt, dass jemand von außen die fragliche Sache tatsächlich versucht, am echten System, mit echter Aussicht zu scheitern. Weil das billige Instrument skaliert und das teure nicht, trägt am Ende das billige den größten Teil des Regimes — und sein Ergebnis landet im selben Bericht, in derselben Schrifttype, wie das Ergebnis des teuren.

Das Gegenmittel ist nicht, den Fragebogen abzuschaffen. Es ist, ihn zu beschriften — jedes Mal, so wie es der CBEST-Bericht 2025 tut und der von 2024 nicht tat — und mindestens ein Instrument im Regime zu halten, das man nicht beantworten, sondern nur überstehen kann. Dieselbe Naht läuft an anderer Stelle durch die Zahlungsaufsicht: Eine Störung erreicht die Aufsicht binnen einer in Stunden gemessenen Frist, den Kunden dagegen, wenn jemand sich entscheidet — weil an einer dieser beiden Pflichten eine Zahl hängt und an der anderen nicht. Das Muster ist immer dasselbe. Gezählt wird, was jemand vorführen musste. Alles andere ist die Erzählung eines Hauses über sich selbst und sollte auch so gelesen werden.