Alle Artikel

Wie wir 3,8 Millionen Websites geprüft haben – und warum 155.000 davon auf 180 Server zeigen

Hinter jeder unserer Zahlen steht dieselbe Frage: Was ist eigentlich eine Website? Im August 2026 haben wir 5,25 Millionen Domains angefasst, 3,82 Millionen erfolgreich gescannt und dann versucht, den Müll herauszurechnen: geparkte Domains, Weiterleitungen, Alias-Adressen, Domainhändler. Dieser Artikel erklärt, wie das geht, was wir dabei gelernt haben, und warum sich die Kernzahlen trotz dreifacher Korpusgröße um weniger als einen Prozentpunkt bewegt haben.

Wie wir 3,8 Millionen Websites geprüft haben – und warum 155.000 davon auf 180 Server zeigen

Wenn wir schreiben „21 % der deutschen Websites tracken vor der Einwilligung", dann steckt in diesem Satz eine Entscheidung, die schwerer ist als die Messung: Was zählt als Website? Eine geparkte Domain mit Werbeplatzhalter? Eine Adresse, die auf eine andere weiterleitet? Ein Domainhändler, der 30.000 Domains auf dieselbe Verkaufsseite lenkt? Im August und September 2026 haben wir unseren Bestand komplett neu gescannt, deutlich ausgeweitet und dann sehr genau nachgesehen, was wir da eigentlich gezählt haben. Das ist der Bericht darüber.

3.824.300
erfolgreich gescannte Websites
von 5,25 Millionen angefassten Domains
155.255
Domains zeigen auf nur 180 Ziel-Server
Domainhändler, Parking, Weiterleitungsfarmen
< 1 pp
Bewegung der Kernzahlen
trotz dreifacher Korpusgröße

Was eine Domain überhaupt in den Bestand bringt

Eine Domain landet bei uns, weil sie existiert – nicht, weil jemand sie für interessant hält. Ein Teil des Bestands ist vorgefiltert: dort haben wir alles entfernt, was sich in einem früheren Durchlauf nicht scannen ließ. Ein anderer Teil ist es nicht und enthält deshalb alles, was technisch eine Adresse hat: Mailserver, Testsysteme, Weiterleitungen, Domains, die jemand gekauft und nie benutzt hat. Diese Mischung ist der Grund, warum der Rest dieses Artikels vom Aufräumen handelt.

Von 5.252.115 angefassten Domains liefern 3.824.300 ein auswertbares Ergebnis, also 72,8 %. Der Rest verteilt sich auf mehrere Fehlerklassen, und die größte ist der Bot-Schutz: Cloudflare und ähnliche Dienste erkennen den Scanner und blocken ihn. Diese Websites fehlen in allen unseren Quoten, und es sind eher die größeren – ein systematischer blinder Fleck, den wir in jeder Auswertung nennen. Dahinter kommen Ladefehler, nicht erreichbare Hosts, Zertifikats- und DNS-Fehler sowie 161.284 Domains, die der Scanner selbst als geparkt erkennt.

Was ein Scan sieht

Jede Website wird in einem frischen Chromium-Browser geladen: keine Cookies, kein Speicher, keine Vorgeschichte. Der Scanner protokolliert jede Verbindung, die der Browser aufbaut, und ordnet sie einem Katalog von über 3.100 Dienst-Signaturen zu. Dann sucht er das Cookie-Banner – über 80 Consent-Manager erkennt er namentlich, weitere an ihren Merkmalen –, klickt auf „Akzeptieren" und protokolliert weiter. Was vor dem Klick lief, ist die Phase 1; was danach dazukommt, die Phase 2. Alles, was wir über Tracking vor der Einwilligung sagen, ist der Unterschied zwischen diesen beiden Listen.

Zwei Zählweisen ziehen sich durch alle Auswertungen. Weit zählt jede Website, bei der in Phase 1 irgendein Drittanbieter-Dienst antwortet, auch Karten, Videos oder Monitoring. Streng zählt nur Analyse, Werbung, Retargeting, Session-Recording und A/B-Tests. Die weite Zahl beantwortet „fließen Daten an Dritte?", die strenge „wird getrackt?". Beide stehen in jeder Auswertung nebeneinander, und die strenge ist die konservative.

Der Müll: 45.000 Domains ein zweites Mal aufgerufen

Ein erfolgreicher Scan heißt nicht, dass da eine Website ist. Wir prüfen das deshalb in zwei Stufen nach.

PrüfschrittUmfangWas er findet
HTTP-Nachprüfung45.000 zufällig gezogene Domains, gleich viele je Teilbestandtot, geparkt, leer, ins Ausland weitergeleitet, vom Bot-Schutz abgewiesen
Ziel-Server-Abgleichalle Domains mit TLS-CheckAlias- und Weiterleitungsdomains, die am selben Ziel ankommen

Die erste Stufe ruft jede gezogene Domain ein zweites Mal auf, diesmal mit einem simplen HTTP-Client statt mit dem Browser, und klassifiziert sie nach festen Regeln. Die zweite nutzt, dass der TLS-Check für jede Domain speichert, wo sie nach allen Weiterleitungen landet: Kommen zwei Domains am selben Ziel an, ist eine davon ein Alias. Meistens ist das harmlos – ein Unternehmen hat fünf Schreibweisen seines Namens registriert. Manchmal ist es das nicht.

Wie viel eine Stichprobe findet, hängt stark davon ab, wie stark der geprüfte Teil des Bestands vorgefiltert ist: Der Müllanteil reicht von 4 bis 14 %, der Alias-Anteil von 8 bis 17 %. Genau diese Spanne ist der Grund, warum wir nicht einfach „gescannt" mit „Website" gleichsetzen.

180 Server, 155.000 Domains

Sortiert man die Ziel-Server nach der Zahl der Domains, die auf sie zeigen, findet man 180 Server mit jeweils mindestens hundert Quell-Domains. Zusammen sammeln sie 155.255 Domains ein. Die Spitze der Liste: ein Parking-Dienst mit 32.330 Domains, ein Domainhändler mit 20.527, eine Werbe-Parkfarm mit 19.300, eine Verkaufsplattform mit 14.669. Dazu Weiterleitungen auf Facebook-Seiten (1.991) und Instagram-Profile (1.416) – Betriebe, die eine Domain gekauft und dann doch nur ein Social-Profil gepflegt haben.

Für den Scanner sind das erfolgreiche Scans ohne Cookie-Banner. Für eine Studie sind es 155.000 Mal dieselbe Seite. Die Lösung ist einfacher als eine Sperrliste: Man zählt je Ziel-Server nur eine Domain. Dann kollabiert jede Farm auf einen Eintrag, ohne dass jemand entscheiden muss, was eine Farm ist.

Was das mit den Zahlen macht

Weniger, als man denkt, und das ist die eigentliche Erkenntnis. Die Stichprobe zieht gleich viele Domains aus jedem Teilbestand, obwohl die Teilbestände sehr unterschiedlich groß sind; wir rechnen ihre Ergebnisse deshalb auf die tatsächlichen Anteile im Korpus zurück. Danach verschiebt die Bereinigung um Müll die Kernzahlen um wenige Zehntel: Tracking vor der Einwilligung (streng) 21,9 % roh, 21,3 % bereinigt; kein Cookie-Banner 57,6 % roh, 56,8 % bereinigt. Die Rückrechnung lässt sich prüfen, weil der ungefilterte Gesamtbestand für beide Achsen auch ohne Stichprobe vorliegt. Er liegt bei 21,9 % und 57,4 %, also innerhalb von zwei Zehnteln. Die Deduplizierung wirkt stärker, weil sie vor allem die Alias-Domains gut gepflegter Unternehmen entfernt: Nach Ziel-Server dedupliziert und auf .de-Ziele beschränkt bleiben 3,07 Millionen Websites, davon 19,7 % mit Tracking vor Consent und 61,1 % ohne Banner. Dass der Banner-Wert dabei steigt, ist kein Widerspruch: Weggefallen sind vor allem die Zweit- und Drittadressen gepflegter Unternehmens-Sites, und die hatten überdurchschnittlich oft ein Banner.

Wirkung der beiden Aufräumschritte auf die zwei Kernzahlen. Die ersten beiden Reihen stammen aus der Hygiene-Stichprobe, zurückgerechnet auf die Korpus-Anteile. Die dritte Reihe steht auf einer engeren Grundgesamtheit: nach Ziel-Server dedupliziert und auf .de-Ziele beschränkt.

Und die Zahlen, die wir im August an einer Stichprobe gemessen hatten, liegen auf dem vollständigen vorgefilterten Bestand, aus dem diese Stichprobe gezogen war, unter zwei Prozentpunkten: Tracking streng 20,2 % gegenüber 21,3 %, kein Banner 53,4 % gegenüber 52,5 %, Banner mangelhaft 94,1 % gegenüber 92,6 %, TLS-Mängel 43,5 % gegenüber 43,9 %. Die Stichprobe war repräsentativ. Die drei Monate Arbeit haben die Zahlen nicht geändert – sie haben sie belastbar gemacht.

Wichtig dabei: Diese vier Vergleichswerte stehen auf dem vorgefilterten Bestand, auf dem wir veröffentlichen, nicht auf allen 3,82 Millionen gescannten Websites. Der Wert für mangelhafte Banner steht zusätzlich auf einer kleineren Basis, weil das Banner-Audit nur einen Teil des Zeitraums lief. Auf dem gesamten Korpus liegen dieselben vier Achsen bei 21,9 %, 57,4 %, 91,3 % und 45,2 %. Der Abstand dazwischen kommt aus der Korpus-Zusammensetzung und nicht aus der Messung, und genau darum geht es im nächsten Abschnitt.

Warum mehr Domains nicht automatisch bessere Zahlen sind

Ein größerer Bestand ist nicht dasselbe wie eine bessere Abdeckung des deutschen Webs. Je weniger vorgefiltert ein Teil des Bestands ist, desto mehr Weiterleitungen, Parking-Seiten und Domains ohne Betrieb dahinter stecken darin – und die schieben Quoten in eine Richtung, die nach Befund aussieht, aber nur Korpus-Mischung ist. Deshalb veröffentlichen wir nicht die jeweils größte erreichbare Zahl, sondern rechnen jede Quote auf einem festen, vorgefilterten Bestand, und deshalb steht in jeder Auswertung, welche Grundgesamtheit gemeint ist. Wer zwei unserer Zahlen vergleicht, muss den Nenner vergleichen können.

Was diese Methodik nicht kann

  • Server-seitiges Tracking sieht ein Browser nicht. Die realen Quoten liegen über den gemessenen.
  • Vom Bot-Schutz geblockte Websites fehlen, und sie sind nicht zufällig verteilt: Große, professionell betriebene Seiten sind häufiger dabei.
  • Ein Scan, eine Startseite. Unterseiten, Shops, Formulare in der Tiefe fehlen im Standardlauf.
  • Der Katalog ist endlich. Über 3.100 Signaturen erkennen viel, aber nicht alles; unbekannte Fremdserver werden als „nicht zuordenbar" geführt und gehen in keine Quote ein.
  • Keine Rechtsbewertung. Jede Zahl beschreibt einen technischen Sachverhalt. Ob er im Einzelfall zulässig ist, entscheidet kein Scanner.

Warum wir das aufschreiben

Weil die Zahl ohne den Nenner nichts wert ist. Jede Studie über „das deutsche Web" trifft die Entscheidungen von oben, und die meisten nennen sie nicht. Wir haben unsere Aggregate als Open Data veröffentlicht und die Methodik in der Studie zum Tracking vor der Einwilligung offengelegt; dieser Artikel ergänzt sie um das, was beim Übergang von 1,2 auf 3,8 Millionen Websites dazugekommen ist. Wie ein einzelner Scan aufgebaut ist und was der Beweisblock zu jedem Befund enthält, steht in der Produktdokumentation. Wer nachrechnen will, findet dort alles, was er braucht.

Häufige Fragen

Wie viele Websites hat Complianty geprüft?

Zwischen dem 8. August und dem 5. September 2026 wurden 5.252.115 Domains angefasst und 3.824.300 davon erfolgreich gescannt, also 72,8 %. Der Rest verteilt sich auf Bot-Schutz, Ladefehler, nicht erreichbare Hosts und geparkte Domains. Veröffentlichte Quoten rechnen wir nicht auf dieser Gesamtzahl, sondern auf einem festen, vorgefilterten Bestand – die Grundgesamtheit steht in jeder Auswertung dabei.

Wie wird eine Website gescannt?

In einem frischen Chromium-Browser ohne Cookies und Vorgeschichte. Der Scanner protokolliert jede Verbindung vor der ersten Interaktion mit dem Cookie-Banner, klickt dann auf Akzeptieren und protokolliert weiter. Die Verbindungen werden einem Katalog von über 3.100 Dienst-Signaturen zugeordnet; über 80 Consent-Manager werden namentlich erkannt. Tracking vor der Einwilligung ist der Unterschied zwischen beiden Phasen.

Wie werden geparkte und doppelte Domains erkannt?

Zweistufig: 45.000 zufällig gezogene Domains wurden per HTTP nachgeprüft und als lebendig, tot, geparkt, leer oder ausländisch klassifiziert – je nach Vorfilterung liegt der Müllanteil zwischen 4 und 14 %. Zusätzlich speichert der TLS-Check den Ziel-Server nach allen Weiterleitungen; Domains mit demselben Ziel gelten als Alias. 180 Server sammeln so 155.255 Domains ein, meist Domainhändler und Parking-Dienste.

Verändert die Bereinigung die Ergebnisse?

Kaum. Auf die Korpus-Anteile zurückgerechnet liegt Tracking vor der Einwilligung (streng) roh bei 21,9 % und bereinigt bei 21,3 %, der Anteil ohne Cookie-Banner bei 57,6 % beziehungsweise 56,8 %. Die Deduplizierung nach Ziel-Server verschiebt mehr, weil sie die Alias-Domains gut gepflegter Unternehmen entfernt. Die Stichprobe vom August liegt auf dem vollständigen vorgefilterten Bestand, aus dem sie gezogen war, unter zwei Prozentpunkten; das ist nicht der gesamte Korpus.

Was ist der Unterschied zwischen weiter und strenger Zählung?

Weit zählt jede Website, bei der vor dem Klick irgendein Drittanbieter-Dienst antwortet, auch Karten, Videos oder Monitoring; das beantwortet die Frage, ob Daten an Dritte fließen. Streng zählt nur Analyse, Werbung, Retargeting, Session-Recording und A/B-Tests; das beantwortet die Frage, ob getrackt wird. Beide Werte stehen in jeder Auswertung, die strenge ist die konservative.

Methodik

Wie Complianty das prüft

Die Produktdokumentation beschreibt das Verfahren hinter diesem Thema — was gemessen wird, auf welcher Grundlage bewertet wird und was eine automatische Prüfung nicht leisten kann. Ohne Anmeldung lesbar.

Gesamte Dokumentation