Ninety-five per cent wrong: the economics of sanctions screening
Zu fünfundneunzig Prozent falsch: die Ökonomie der Sanktionsprüfung
Every cross-border payment is screened against sanctions lists before it settles. The screening produces alerts. Somewhere between 90 and 99 per cent of those alerts are wrong — the transaction is legitimate, the name merely resembled one on a list. That is not a scandal or a failure. It is the intended operating point of the system, and understanding why is more useful than being outraged by the number.
The number, and its provenance
False-positive rates in sanctions screening are reported at 90 to 95 per cent across institutions globally, with figures approaching 99 per cent cited specifically for cross-border payment screening. The range reflects genuine variation between institutions, systems and lists, and it also reflects that different studies count differently — some measure alerts, some measure alerted transactions, some measure alerts after automated suppression.
The cost is easier to bound than the rate. Industry estimates put investigation cost at several hundred to well over a thousand dollars per alert, with a single large institution handling tens of thousands of alerts annually. Aggregated across the sector, published estimates of the annual cost of false positives run into the billions, and those estimates are generally described by their authors as conservative.
Treat all of these as order-of-magnitude figures. The important point survives any reasonable adjustment: the overwhelming majority of the output of this control is noise, and processing the noise is one of the larger operating costs in international banking.
Why the rate is high by design
This is the part that is usually skipped, and without it the number invites the wrong conclusion.
Sanctions screening is a name-matching problem, and name matching is intrinsically fuzzy. The same person appears in different sources as different transliterations of the same name. Name order varies by culture. Diminutives, patronymics, honorifics and spelling variants multiply the surface. A system that matched only exact strings would be trivially defeated by a single changed letter, so screening systems match approximately, using phonetic and edit-distance algorithms tuned to catch variants.
Tune that matching tightly and you miss real matches. Tune it loosely and you generate alerts on every customer who shares a common surname with a listed person. There is no setting that does neither, and the two errors are not symmetric in consequence.
A missed match is a sanctions breach: a regulatory enforcement action, a penalty that can reach into the hundreds of millions, potential criminal exposure, and reputational damage that outlasts the fine. A false positive is a delayed payment and an analyst’s time. Any rational institution, facing that asymmetry, sets the threshold loose. The 95 per cent false-positive rate is not a bug in the tuning. It is the tuning.
Who actually pays
The cost is usually discussed as a compliance expense, which understates it by measuring only the part that appears on a bank’s own ledger.
The larger cost falls outside. A payment held for investigation is a payment that does not arrive. For a business paying a supplier, that is a working-capital problem. For a person sending money to family in another country, it is rent not paid this week. The delay is distributed across the population of people making cross-border payments, and it lands hardest on those making small payments to and from jurisdictions that generate more alerts — which correlates strongly with the places where the money matters most.
There is a second-order cost that is larger still and almost never attributed. An institution facing high alert volumes on a customer category can reduce the volume by declining the category. That is a rational cost-control measure, and it is one of the mechanisms behind the withdrawal of banking services from money transfer businesses, charities operating in difficult regions, and correspondent relationships in lower-scoring jurisdictions. The screening system’s false-positive rate is one of the inputs to a decision that ends with a lawful business being unable to obtain an account.
Common names carry the burden
One consequence deserves to be stated directly, because the people affected by it are rarely in the room when screening thresholds are discussed.
The probability that a given person’s name generates alerts is a function of how common that name is and how many listed individuals share it. Sanctions lists are not evenly distributed across the world’s naming conventions; they concentrate on particular countries and regions. A person whose name is common in one of those regions will trigger alerts repeatedly, for the whole of their life, on transactions that have nothing to do with anything.
From the bank’s side this is a resolved alert and a closed case. From the customer’s side it is a recurring experience of having payments held, being asked for documents, and receiving explanations that cannot be given because the reason for the delay is often itself restricted information. The burden of a system tuned for over-inclusion falls on people selected by the statistical properties of their name.
This is not discrimination in any intentional sense, and nobody designed it. It is a distributional consequence of a threshold, and it is invisible in every metric the industry reports, because the industry measures alerts and not people.
What would actually reduce the rate
Three interventions have evidence behind them, and one popular answer does not.
Better identifiers. Most false positives are name collisions. A date of birth, a national identifier or a verified address discriminates instantly between two people with the same name. The constraint is that payment messages have historically carried very little structured data about the parties. Richer payment message standards address this directly, and the migration to them is the single largest available reduction in false positives — which is a reason to care about a technical standards migration that otherwise sounds like plumbing.
List quality. Alert volume is partly a function of how well-specified list entries are. An entry with a name and nothing else is a false-positive generator. Entries with dates of birth, identifiers and known aliases are not. This is within the control of the authorities publishing the lists, and it is not consistently done.
Shared resolution. The same false positive is investigated independently at every institution the customer deals with, every time. Nothing about the customer changes between investigations. Mechanisms for sharing the outcome of a resolved match — under appropriate legal protection — would remove a large volume of duplicated work.
The answer that does not work on its own is machine learning applied to alert triage. It reduces the analyst time per alert, which is worth having. It does not change the underlying asymmetry, and no institution will let a model close an alert unreviewed when the downside of a wrong closure is a nine-figure penalty. Automating the handling of noise is not the same as producing less noise.
The structural observation
A control that is wrong 95 per cent of the time would be abandoned in almost any other setting. This one persists, and correctly so, because it is not a prediction system. It is a filter designed under an asymmetry so extreme that precision is not the objective.
What is missing is not accuracy. It is accounting. The cost of the false positives is real, large, and borne substantially by people who are not party to the decision that sets the threshold. Nobody publishes it, no regulator requires it to be measured, and no assessment of whether the sanctions regime is proportionate can be made without it.
You cannot evaluate a trade-off when only one side of it is counted.
Jede grenzüberschreitende Zahlung wird vor der Ausführung gegen Sanktionslisten geprüft. Die Prüfung erzeugt Treffermeldungen. Zwischen 90 und 99 Prozent davon sind falsch — die Zahlung ist rechtmäßig, der Name ähnelte lediglich einem auf einer Liste. Das ist kein Skandal und kein Versagen. Es ist der beabsichtigte Betriebspunkt des Systems, und zu verstehen, warum, ist nützlicher, als sich über die Zahl zu empören.
Die Zahl und ihre Herkunft
Fehlalarmquoten in der Sanktionsprüfung werden institutsübergreifend mit 90 bis 95 Prozent angegeben, mit Werten nahe 99 Prozent speziell für die Prüfung grenzüberschreitender Zahlungen. Die Spanne spiegelt echte Unterschiede zwischen Instituten, Systemen und Listen — und den Umstand, dass verschiedene Untersuchungen verschieden zählen: mal Meldungen, mal gemeldete Transaktionen, mal Meldungen nach automatischer Unterdrückung.
Die Kosten lassen sich leichter eingrenzen als die Quote. Branchenschätzungen setzen mehrere hundert bis weit über tausend Dollar je Untersuchung an, bei zehntausenden Meldungen jährlich in einem einzigen großen Institut. Über den Sektor aggregiert liegen veröffentlichte Schätzungen der jährlichen Kosten von Fehlalarmen im Milliardenbereich, und ihre Autoren nennen sie in der Regel konservativ.
Alle diese Werte sind als Größenordnungen zu lesen. Der wesentliche Punkt übersteht jede vernünftige Korrektur: Die ganz überwiegende Ausgabe dieser Kontrolle ist Rauschen, und die Bearbeitung dieses Rauschens gehört zu den größeren Betriebskosten im internationalen Bankgeschäft.
Warum die Quote konstruktionsbedingt hoch ist
Dieser Teil wird meist übersprungen, und ohne ihn lädt die Zahl zum falschen Schluss ein.
Sanktionsprüfung ist ein Namensabgleichsproblem, und Namensabgleich ist von Natur aus unscharf. Dieselbe Person erscheint in verschiedenen Quellen in verschiedenen Umschriften desselben Namens. Die Reihenfolge der Namensbestandteile unterscheidet sich kulturell. Kurzformen, Vatersnamen, Titel und Schreibvarianten vervielfachen die Oberfläche. Ein System, das nur exakte Zeichenketten abgliche, wäre mit einem einzigen geänderten Buchstaben zu überwinden — also gleichen Prüfsysteme näherungsweise ab, mit phonetischen und abstandsbasierten Verfahren, eingestellt auf das Erkennen von Varianten.
Stellt man den Abgleich eng, übersieht man echte Treffer. Stellt man ihn weit, erzeugt man Meldungen zu jedem Kunden, der einen häufigen Nachnamen mit einer gelisteten Person teilt. Es gibt keine Einstellung, die beides vermeidet — und die beiden Fehler sind in ihren Folgen nicht symmetrisch.
Ein übersehener Treffer ist ein Sanktionsverstoß: ein Aufsichtsverfahren, ein Bußgeld, das in die Hunderte Millionen reichen kann, mögliche strafrechtliche Folgen und ein Reputationsschaden, der die Strafe überdauert. Ein Fehlalarm ist eine verzögerte Zahlung und die Zeit eines Sachbearbeiters. Jedes vernünftige Institut stellt bei dieser Asymmetrie die Schwelle weit. Die Fehlalarmquote von 95 Prozent ist kein Fehler in der Einstellung. Sie ist die Einstellung.
Wer tatsächlich zahlt
Die Kosten werden meist als Compliance-Aufwand erörtert, was sie untertreibt, weil nur der Teil gemessen wird, der im Buch der Bank erscheint.
Der größere Teil fällt außerhalb an. Eine zur Prüfung angehaltene Zahlung ist eine Zahlung, die nicht ankommt. Für ein Unternehmen, das einen Lieferanten bezahlt, ist das ein Working-Capital-Problem. Für jemanden, der Geld an Familie im Ausland schickt, ist es eine Miete, die diese Woche nicht gezahlt wird. Die Verzögerung verteilt sich über alle, die grenzüberschreitend zahlen, und trifft am härtesten diejenigen mit kleinen Beträgen aus und in Länder, die mehr Meldungen erzeugen — was stark mit den Orten korreliert, an denen das Geld am meisten zählt.
Es gibt eine noch größere Zweitrundenwirkung, die fast nie zugeordnet wird. Ein Institut mit hohem Meldeaufkommen bei einer Kundenkategorie kann das Aufkommen senken, indem es die Kategorie ablehnt. Das ist eine vernünftige Kostenmaßnahme — und einer der Mechanismen hinter dem Rückzug von Bankdienstleistungen aus dem Finanztransfergeschäft, aus gemeinnützigen Organisationen in schwierigen Regionen und aus Korrespondenzbeziehungen in schlechter bewerteten Ländern. Die Fehlalarmquote des Prüfsystems ist eine der Eingangsgrößen einer Entscheidung, an deren Ende ein rechtmäßiges Unternehmen kein Konto bekommt.
Häufige Namen tragen die Last
Eine Folge gehört ausdrücklich benannt, weil die Betroffenen selten im Raum sind, wenn über Prüfschwellen gesprochen wird.
Die Wahrscheinlichkeit, dass ein Name Meldungen erzeugt, hängt davon ab, wie häufig er ist und wie viele gelistete Personen ihn tragen. Sanktionslisten sind nicht gleichmäßig über die Namenskonventionen der Welt verteilt; sie konzentrieren sich auf bestimmte Länder und Regionen. Wer einen dort häufigen Namen trägt, löst wiederholt Meldungen aus — ein Leben lang, bei Zahlungen, die mit nichts zu tun haben.
Aus Sicht der Bank ist das eine geklärte Meldung und ein geschlossener Vorgang. Aus Sicht des Kunden ist es die wiederkehrende Erfahrung, dass Zahlungen angehalten werden, Unterlagen verlangt werden und Erklärungen ausbleiben, weil der Grund der Verzögerung oft selbst geschützte Information ist. Die Last eines auf Übererfassung eingestellten Systems trifft Menschen, ausgewählt nach den statistischen Eigenschaften ihres Namens.
Das ist keine Diskriminierung in einem absichtlichen Sinn, und niemand hat es so entworfen. Es ist die Verteilungsfolge einer Schwelle — und sie ist in jeder Kennzahl, die die Branche berichtet, unsichtbar, weil die Branche Meldungen misst und keine Menschen.
Was die Quote tatsächlich senken würde
Drei Eingriffe haben Belege für sich, eine populäre Antwort nicht.
Bessere Identifikatoren. Die meisten Fehlalarme sind Namenskollisionen. Ein Geburtsdatum, eine nationale Kennung oder eine geprüfte Anschrift unterscheidet sofort zwischen zwei Personen desselben Namens. Der Engpass ist, dass Zahlungsnachrichten historisch sehr wenig strukturierte Daten über die Beteiligten trugen. Reichhaltigere Nachrichtenstandards adressieren genau das, und ihre Einführung ist die größte verfügbare Einzelmaßnahme zur Senkung der Fehlalarme — ein Grund, sich für eine technische Standardmigration zu interessieren, die sonst nach Rohrleitungsbau klingt.
Listenqualität. Das Meldeaufkommen hängt auch daran, wie gut Listeneinträge spezifiziert sind. Ein Eintrag mit einem Namen und sonst nichts ist ein Fehlalarmerzeuger. Einträge mit Geburtsdaten, Kennungen und bekannten Aliasnamen sind es nicht. Das liegt in der Hand der listenführenden Behörden und geschieht nicht durchgängig.
Geteilte Klärung. Derselbe Fehlalarm wird bei jedem Institut, mit dem der Kunde zu tun hat, jedes Mal eigenständig untersucht. Am Kunden ändert sich zwischen den Untersuchungen nichts. Verfahren, das Ergebnis einer geklärten Übereinstimmung zu teilen — unter angemessenem rechtlichem Schutz — würden ein großes Volumen doppelter Arbeit beseitigen.
Die Antwort, die für sich allein nicht trägt, ist maschinelles Lernen zur Vorsortierung. Es senkt die Bearbeitungszeit je Meldung, was wertvoll ist. Es ändert die zugrunde liegende Asymmetrie nicht, und kein Institut lässt ein Modell eine Meldung ungeprüft schließen, wenn die Kehrseite einer falschen Schließung ein neunstelliges Bußgeld ist. Die Bearbeitung von Rauschen zu automatisieren ist nicht dasselbe, wie weniger Rauschen zu erzeugen.
Die strukturelle Beobachtung
Eine Kontrolle, die zu 95 Prozent falsch liegt, würde in fast jedem anderen Zusammenhang aufgegeben. Diese besteht fort, und zu Recht, weil sie kein Prognosesystem ist. Sie ist ein Filter, entworfen unter einer so extremen Asymmetrie, dass Präzision nicht das Ziel ist.
Was fehlt, ist nicht Genauigkeit. Es ist Rechenschaft. Die Kosten der Fehlalarme sind real, groß und werden zu einem erheblichen Teil von Menschen getragen, die an der Entscheidung über die Schwelle nicht beteiligt sind. Niemand veröffentlicht sie, keine Aufsicht verlangt ihre Messung — und ohne sie lässt sich nicht beurteilen, ob das Sanktionsregime verhältnismäßig ist.
Eine Abwägung lässt sich nicht bewerten, wenn nur eine Seite gezählt wird.