Enriquezca cualquier cosa que contenga un dominio, a partir de un único archivo JSONL

409M dominios activos con señales de DNS, WHOIS, tecnología y clasificación, una fila por dominio, reconstruidos a diario. El export completo cuesta €599. Entrene modelos, puntúe sus registros y lance su propio producto de datos encima.

Obtener la muestra gratuita de 10K Ver all-data, €599

¿Puedo construir un producto con esto? Leer la licencia →

409M+dominios activos, una fila cada uno
€1,46por 1M de registros completos
32,5 GBun archivo JSONL por exportación
Diarioexportaciones reconstruidas, mismo esquema

Su pipeline, nuestro archivo

Cuatro recetas sobre el esquema real. Cada clave de abajo es exactamente lo que se incluye en la exportación. Pruebe cualquiera de ellas primero con la muestra gratuita de 10.000 filas.

DomainTLDDomain typeHTTP statusIP addressCountry by IPTechnologiesDNS recordsPR valueHarmonic valueRegistrarDomain creation dateDomain expiration dateRDAP/WHOIS Record

Una lista de leads, directamente del archivo

Cada sitio WordPress con un registro MX activo, transmitido directamente desde la exportación. Nada se guarda en disco.

bash + jq
# Technologies ships as a list of names, or a name-to-version map.
# One line normalizes both shapes.
zstdcat webatla-all-data-2026-08-18.jsonl.zst |
jq -c 'def techs: (.Technologies // []) | if type == "object" then keys else . end;
   select(techs | index("WordPress"))
   | select((."DNS records" // {}) | has("MX"))
   | {domain: .Domain, tld: .TLD, rank: ."PR value"}' \
  > wordpress-with-mail.jsonl

Adopción de tecnología por TLD

Agregue datos de 1431 TLD directamente sobre el archivo, sin paso de carga. DuckDB lee el campo technology como JSON, así que pregúntele primero por el tipo.

duckdb
SELECT "TLD", count(*) AS domains
FROM read_json('webatla-all-data-2026-08-18.jsonl.zst',
       format='newline_delimited', compression='zstd',
       columns={'TLD':'VARCHAR', 'Technologies':'JSON'})
WHERE list_contains(
        CASE json_type("Technologies")
          WHEN 'ARRAY'  THEN json_extract_string("Technologies", '$[*]')
          WHEN 'OBJECT' THEN json_keys("Technologies")
          ELSE []::VARCHAR[] END, 'WordPress')
GROUP BY "TLD" ORDER BY domains DESC LIMIT 20;

Enriquezca su CRM mediante la clave de dominio

Haga un LEFT JOIN entre sus propios registros y la exportación. País, ranking y stack aparecen junto a cada fila que ya tenía.

duckdb
SELECT c.*, w."Country by IP", w."PR value", w."Registrar"
FROM 'crm.csv' c
LEFT JOIN (
  SELECT "Domain", "Country by IP", "PR value", "Registrar"
  FROM read_json('webatla-all-data-2026-08-18.jsonl.zst',
         format='newline_delimited', compression='zstd',
         columns={'Domain':'VARCHAR', 'Country by IP':'VARCHAR',
                  'PR value':'DOUBLE', 'Registrar':'VARCHAR'})
) w ON lower(c.domain) = w."Domain";

Pasada de memoria constante en un portátil

Transmita las 409.807.815 filas sin mantener el archivo en RAM. Construya features, puntúelas y expórtelas.

python
import io, json, zstandard as zstd

with open("webatla-all-data-2026-08-18.jsonl.zst", "rb") as f:
    for line in io.TextIOWrapper(zstd.ZstdDecompressor().stream_reader(f)):
        r = json.loads(line)
        t = r.get("Technologies") or []
        names = list(t) if isinstance(t, dict) else t
        if "WordPress" in names and (r.get("DNS records") or {}).get("MX"):
            print(r["Domain"], r.get("Registrar"))

La receta uno y la receta cuatro son la misma consulta en dos motores, y sobre la misma exportación devuelven las mismas filas. Verificar un mismo filtro en dos herramientas es la forma de validar cualquier pipeline que construya sobre esto.

¿Puede construir un producto con esto? Sí

El reparto honesto. Construya sobre los datos y venda lo que construya. Revender las filas en bruto es otro negocio, y así es como lo tarificamos.

Permitido de serie

  • Enriquecer sus propios registros y los de sus clientes
  • Entrenar modelos y vender las puntuaciones, clasificaciones y veredictos
  • Impulsar búsquedas y funcionalidades dentro de su producto
  • Publicar conclusiones agregadas, estudios e informes

Lo que construya le pertenece. Comprar un dataset le da la licencia, no la base de datos subyacente.

Empezar con all-data

Enviar filas en bruto requiere un acuerdo

  • Revender o redistribuir los datasets en bruto, en su totalidad o en gran parte
  • Sublicenciar el export a terceros

La redistribución de datos en bruto es un negocio distinto, y lo tarificamos como tal. Eso es precisamente lo que mantiene el archivo tan barato para todos los demás. Los derechos de redistribución personalizados son negociables.

Hablar con ventas

La prueba de una sola pregunta: ¿está vendiendo nuestras filas o está vendiendo lo que ha hecho con ellas? La segunda opción no necesita permiso. El texto completo está en los términos.

Qué efecto tiene esto en su coste de ventas

El precio de enriquecimiento por uso crece con su volumen, así que su margen se reduce justo cuando tiene éxito. Un archivo plano no tiene ese problema.

all-data, exportación completa€599
registros en la exportación409.807.815
descargas repetidas durante un mesilimitado
facturación por solicitudninguno
409.807.815 ÷ €599 €1,46 / 1M registros

Su partida de datos se redondea a cero

A €1,46 por millón de registros completos, el coste de los datos subyacentes deja de ser una partida que merezca la pena optimizar.

El coste deja de depender del uso

Su margen ya no se reduce cuando el producto crece. El archivo cuesta lo mismo tanto si lo consulta una vez como mil millones de veces.

Empiece más pequeño si lo prefiere

all-active-domains cuesta €29 por el espacio de nombres completo. Valide el pipeline y después tome todas las columnas.

Encaja donde ya viven sus datos

Un archivo JSON con un objeto por línea, en compresión estándar. Sin SDK, sin formato propietario, sin cliente de proveedor.

jq y shell

Transmita el archivo en streaming y fíltrelo. Nunca tiene que escribirlo entero en disco.

DuckDB y ClickHouse

Ambos leen JSON delimitado por saltos de línea directamente, compresión incluida. Declare las columnas para evitar la inferencia de tipos en las filas anchas.

Spark y pandas

Lectores JSONL estándar. En bloques o en streaming, el esquema es el mismo en cada línea.

BigQuery

BigQuery carga NDJSON sin comprimir, así que descomprima el archivo al importarlo o guárdelo antes en el almacenamiento.

Polars y Arrow

Escanee el archivo en modo diferido y filtre antes de que nada se materialice. Pase el resultado directamente a Arrow.

Snowflake y Databricks

Ambos ingieren JSON delimitado por saltos de línea desde el almacenamiento de objetos. Guarde el archivo una vez y después apunte un stage o un volumen hacia él.

Las preguntas que los ingenieros realmente hacen

Respondidas sin rodeos.

¿Es el esquema estable entre exportaciones?

Sí, las claves y su significado se mantienen estables en cada reconstrucción diaria, y están documentadas. Vale la pena conocer dos formas antes de escribir el parser. Technologies llega como una lista de nombres, o como un mapa de nombre a versión cuando hemos detectado versiones. Los campos vacíos llegan como null en lugar de omitirse, así que cada línea tiene las mismas claves.

¿Cómo de actualizado está?

Cada dataset se reconstruye a diario. El acceso incluye un mes natural de descargas repetidas, así que puede obtener la exportación más reciente tantas veces como su pipeline lo necesite.

¿Puedo incluir esto en un producto que vendo?

Sí. El enriquecimiento, las puntuaciones, las clasificaciones, las búsquedas y las conclusiones agregadas son suyos para vender. Revender las filas en bruto requiere un acuerdo de redistribución por escrito. Consulte el reparto de licencia anterior.

Qué contienen los registros, y qué no

Registros públicos de registro, DNS y tecnología. Sin datos personales de contacto, así que sin nombres de titulares, sin correos electrónicos, sin números de teléfono. Es una decisión de diseño deliberada, y es lo que hace que el archivo sea seguro para incluir dentro de un producto que venda.

¿Tengo que descargar 30 GB para probarlo?

No. Cada dataset tiene una muestra gratuita de 10.000 filas sin necesidad de cuenta. La API bearer incluida también sirve un fragmento por TLD, país o tecnología a la vez, a 240 solicitudes por minuto.

Ejecute una receta con 10.000 filas reales

Sin cuenta, sin correo electrónico. Si la muestra se procesa sin errores en su pipeline, el export completo cuesta €599 y el esquema no cambia.