Reichern Sie alles an, worin eine Domain steckt, aus einer einzigen JSONL-Datei
409M aktive Domains mit DNS-, WHOIS-, Technologie- und Ranking-Signalen, je eine Zeile pro Domain, täglich neu aufgebaut. Der vollständige Export kostet €599. Trainieren Sie Modelle, bewerten Sie Ihre Einträge und bauen Sie darauf Ihr eigenes Datenprodukt auf.
Ihre Pipeline, unsere Datei
Vier Rezepte auf dem echten Schema. Jeder Schlüssel unten kommt genau so im Export vor. Probieren Sie eines davon zuerst an der kostenlosen Probe mit 10.000 Zeilen aus.
DomainTLDDomain typeHTTP statusIP addressCountry by IPTechnologiesDNS recordsPR valueHarmonic valueRegistrarDomain creation dateDomain expiration dateRDAP/WHOIS Record
Eine Lead-Liste direkt aus der Datei
Jede WordPress-Site mit aktivem MX-Record, direkt aus dem Export gestreamt. Nichts landet auf der Festplatte.
# Technologies ships as a list of names, or a name-to-version map. # One line normalizes both shapes. zstdcat webatla-all-data-2026-08-17.jsonl.zst | jq -c 'def techs: (.Technologies // []) | if type == "object" then keys else . end; select(techs | index("WordPress")) | select((."DNS records" // {}) | has("MX")) | {domain: .Domain, tld: .TLD, rank: ."PR value"}' \ > wordpress-with-mail.jsonl
Technologieverbreitung nach TLD
Aggregieren Sie über 1.432 TLDs direkt in der Datei, ohne Ladeschritt. DuckDB liest das Technologiefeld als JSON, fragen Sie deshalb zuerst dessen Typ ab.
SELECT "TLD", count(*) AS domains FROM read_json('webatla-all-data-2026-08-17.jsonl.zst', format='newline_delimited', compression='zstd', columns={'TLD':'VARCHAR', 'Technologies':'JSON'}) WHERE list_contains( CASE json_type("Technologies") WHEN 'ARRAY' THEN json_extract_string("Technologies", '$[*]') WHEN 'OBJECT' THEN json_keys("Technologies") ELSE []::VARCHAR[] END, 'WordPress') GROUP BY "TLD" ORDER BY domains DESC LIMIT 20;
Reichern Sie Ihr CRM über den Domain-Schlüssel an
Verbinden Sie Ihre eigenen Einträge per LEFT JOIN mit dem Export. Land, Ranking und Tech-Stack stehen dann neben jeder Zeile, die Sie schon hatten.
SELECT c.*, w."Country by IP", w."PR value", w."Registrar" FROM 'crm.csv' c LEFT JOIN ( SELECT "Domain", "Country by IP", "PR value", "Registrar" FROM read_json('webatla-all-data-2026-08-17.jsonl.zst', format='newline_delimited', compression='zstd', columns={'Domain':'VARCHAR', 'Country by IP':'VARCHAR', 'PR value':'DOUBLE', 'Registrar':'VARCHAR'}) ) w ON lower(c.domain) = w."Domain";
Durchlauf mit konstantem Speicherbedarf auf dem Laptop
Streamen Sie alle 409.870.541 Zeilen, ohne die Datei im RAM zu halten. Berechnen Sie Features, bewerten Sie sie und schreiben Sie das Ergebnis heraus.
import io, json, zstandard as zstd with open("webatla-all-data-2026-08-17.jsonl.zst", "rb") as f: for line in io.TextIOWrapper(zstd.ZstdDecompressor().stream_reader(f)): r = json.loads(line) t = r.get("Technologies") or [] names = list(t) if isinstance(t, dict) else t if "WordPress" in names and (r.get("DNS records") or {}).get("MX"): print(r["Domain"], r.get("Registrar"))
Rezept eins und Rezept vier sind dieselbe Abfrage in zwei Engines, und auf demselben Export liefern sie dieselben Zeilen. Denselben Filter in zwei Werkzeugen gegenzuprüfen ist genau der Weg, jede Pipeline zu validieren, die Sie darauf aufbauen.
Dürfen Sie damit ein Produkt bauen? Ja
Die ehrliche Aufteilung. Bauen Sie auf den Daten auf und verkaufen Sie, was Sie bauen. Die Rohzeilen weiterzugeben ist ein anderes Geschäft, und so bepreisen wir es auch.
Von Haus aus erlaubt
- Ihre eigenen Einträge und die Ihrer Kunden anreichern
- Modelle trainieren und die Scores, Klassifizierungen und Bewertungen verkaufen
- Lookups und Funktionen in Ihrem Produkt betreiben
- Aggregierte Erkenntnisse, Studien und Berichte veröffentlichen
Was Sie bauen, gehört Ihnen. Der Kauf eines Datensatzes gibt Ihnen die Lizenz, nicht die zugrunde liegende Datenbank.
Mit all-data startenFür die Weitergabe von Rohzeilen braucht es eine Vereinbarung
- Weiterverkauf oder Weiterverbreitung der rohen Datensätze, ganz oder in wesentlichen Teilen
- Unterlizenzierung des Exports an Dritte
Die Weiterverbreitung der Rohdaten ist ein anderes Geschäft, und so bepreisen wir sie auch. Genau das hält die Datei selbst für alle anderen so günstig. Individuelle Verbreitungsrechte sind verhandelbar.
Vertrieb kontaktierenDer Test mit einer einzigen Frage: Verkaufen Sie unsere Zeilen oder das, was Sie daraus gemacht haben? Für das Zweite brauchen Sie keine Erlaubnis. Der vollständige Wortlaut steht in den Nutzungsbedingungen.
Was das mit Ihren Herstellkosten macht
Nutzungsabhängige Preise für Anreicherung steigen mit Ihrem Volumen, Ihre Marge schrumpft also genau dann, wenn Sie erfolgreich sind. Eine einfache Datei tut das nicht.
Ihre Datenkosten gehen gegen null
Bei €1,46 pro Million vollständiger Einträge lohnt es sich nicht mehr, die Kosten der zugrunde liegenden Daten zu optimieren.
Die Kosten folgen nicht mehr der Nutzung
Ihre Marge schrumpft nicht mehr, wenn das Produkt wächst. Die Datei kostet gleich viel, ob Sie sie einmal oder eine Milliarde Mal abfragen.
Fangen Sie ruhig kleiner an
all-active-domains kostet €29 für den kompletten Namensraum. Testen Sie die Pipeline, danach nehmen Sie alle Spalten.
Es passt dorthin, wo Ihre Daten schon liegen
Eine JSON-Datei mit einem Objekt pro Zeile in Standardkompression. Kein SDK, kein proprietäres Format, kein Hersteller-Client.
jq und Shell
Streamen Sie die Datei und filtern Sie sie. Sie müssen sie nie vollständig auf die Festplatte schreiben.
DuckDB und ClickHouse
Beide lesen zeilenweises JSON direkt, samt Kompression. Deklarieren Sie die Spalten, um die Typerkennung bei den breiten Zeilen zu überspringen.
Spark und pandas
Standard-JSONL-Reader. Ob in Chunks oder als Stream, das Schema ist in jeder Zeile gleich.
BigQuery
BigQuery lädt reines NDJSON, entpacken Sie die Datei also beim Import oder legen Sie sie zuerst im Storage ab.
Polars und Arrow
Scannen Sie die Datei im Lazy-Modus und filtern Sie, bevor irgendetwas materialisiert wird. Übergeben Sie das Ergebnis direkt an Arrow.
Snowflake und Databricks
Beide lesen zeilenweises JSON aus dem Object Storage. Legen Sie die Datei einmal ab und richten Sie dann eine Stage oder ein Volume darauf aus.
Die Fragen, die Entwickler wirklich stellen
Antworten ohne Ausflüchte.
Ist das Schema über alle Exporte hinweg stabil?
Ja, die Schlüssel und ihre Bedeutung bleiben über die täglichen Neuaufbauten hinweg gleich und sind dokumentiert. Zwei Formen sollten Sie kennen, bevor Sie den Parser schreiben. Technologies kommt als Liste von Namen oder als Zuordnung von Name zu Version, wenn wir Versionen erkannt haben. Leere Felder kommen als null und fallen nicht weg, jede Zeile hat also dieselben Schlüssel.
Wie aktuell sind die Daten?
Jeder Datensatz wird täglich neu aufgebaut. Der Zugriffszeitraum umfasst einen Kalendermonat, in dem Sie beliebig oft erneut herunterladen können. Sie holen den neuesten Export also so oft, wie Ihre Pipeline es braucht.
Darf ich das in ein Produkt einbauen, das ich verkaufe?
Ja. Anreicherung, Scores, Klassifizierungen, Lookups und aggregierte Erkenntnisse dürfen Sie verkaufen. Für die Weitergabe der Rohzeilen brauchen Sie eine schriftliche Vereinbarung zur Weiterverbreitung. Siehe Lizenzaufteilung oben.
Was in den Einträgen steht und was nicht
Öffentliche Registrierungs-, DNS- und Technologiedaten. Keine personenbezogenen Kontaktdaten, also keine Namen von Domaininhabern, keine E-Mail-Adressen, keine Telefonnummern. Das ist eine bewusste Designentscheidung, und genau sie macht die Datei sicher für den Einsatz in einem Produkt, das Sie verkaufen.
Muss ich 30 GB herunterladen, um es zu testen?
Nein. Jeder Datensatz hat eine kostenlose Probe mit 10.000 Zeilen, ganz ohne Konto. Die enthaltene Bearer-API liefert außerdem jeweils einen Ausschnitt nach TLD, Land oder Technologie, mit 240 Anfragen pro Minute.
Führen Sie ein Rezept auf 10.000 echten Zeilen aus
Kein Konto, keine E-Mail. Wenn die Probe in Ihrer Pipeline sauber geparst wird, kostet der vollständige Export €599 und das Schema bleibt gleich.