Enriquezca cualquier cosa que contenga un dominio, a partir de un único archivo JSONL
409M dominios activos con señales de DNS, WHOIS, tecnología y clasificación, una fila por dominio, reconstruidos a diario. El export completo cuesta €599. Entrene modelos, puntúe sus registros y lance su propio producto de datos encima.
Su pipeline, nuestro archivo
Cuatro recetas sobre el esquema real. Cada clave de abajo es exactamente lo que se incluye en la exportación. Pruebe cualquiera de ellas primero con la muestra gratuita de 10.000 filas.
DomainTLDDomain typeHTTP statusIP addressCountry by IPTechnologiesDNS recordsPR valueHarmonic valueRegistrarDomain creation dateDomain expiration dateRDAP/WHOIS Record
Una lista de leads, directamente del archivo
Cada sitio WordPress con un registro MX activo, transmitido directamente desde la exportación. Nada se guarda en disco.
# Technologies ships as a list of names, or a name-to-version map. # One line normalizes both shapes. zstdcat webatla-all-data-2026-08-18.jsonl.zst | jq -c 'def techs: (.Technologies // []) | if type == "object" then keys else . end; select(techs | index("WordPress")) | select((."DNS records" // {}) | has("MX")) | {domain: .Domain, tld: .TLD, rank: ."PR value"}' \ > wordpress-with-mail.jsonl
Adopción de tecnología por TLD
Agregue datos de 1431 TLD directamente sobre el archivo, sin paso de carga. DuckDB lee el campo technology como JSON, así que pregúntele primero por el tipo.
SELECT "TLD", count(*) AS domains FROM read_json('webatla-all-data-2026-08-18.jsonl.zst', format='newline_delimited', compression='zstd', columns={'TLD':'VARCHAR', 'Technologies':'JSON'}) WHERE list_contains( CASE json_type("Technologies") WHEN 'ARRAY' THEN json_extract_string("Technologies", '$[*]') WHEN 'OBJECT' THEN json_keys("Technologies") ELSE []::VARCHAR[] END, 'WordPress') GROUP BY "TLD" ORDER BY domains DESC LIMIT 20;
Enriquezca su CRM mediante la clave de dominio
Haga un LEFT JOIN entre sus propios registros y la exportación. País, ranking y stack aparecen junto a cada fila que ya tenía.
SELECT c.*, w."Country by IP", w."PR value", w."Registrar" FROM 'crm.csv' c LEFT JOIN ( SELECT "Domain", "Country by IP", "PR value", "Registrar" FROM read_json('webatla-all-data-2026-08-18.jsonl.zst', format='newline_delimited', compression='zstd', columns={'Domain':'VARCHAR', 'Country by IP':'VARCHAR', 'PR value':'DOUBLE', 'Registrar':'VARCHAR'}) ) w ON lower(c.domain) = w."Domain";
Pasada de memoria constante en un portátil
Transmita las 409.807.815 filas sin mantener el archivo en RAM. Construya features, puntúelas y expórtelas.
import io, json, zstandard as zstd with open("webatla-all-data-2026-08-18.jsonl.zst", "rb") as f: for line in io.TextIOWrapper(zstd.ZstdDecompressor().stream_reader(f)): r = json.loads(line) t = r.get("Technologies") or [] names = list(t) if isinstance(t, dict) else t if "WordPress" in names and (r.get("DNS records") or {}).get("MX"): print(r["Domain"], r.get("Registrar"))
La receta uno y la receta cuatro son la misma consulta en dos motores, y sobre la misma exportación devuelven las mismas filas. Verificar un mismo filtro en dos herramientas es la forma de validar cualquier pipeline que construya sobre esto.
¿Puede construir un producto con esto? Sí
El reparto honesto. Construya sobre los datos y venda lo que construya. Revender las filas en bruto es otro negocio, y así es como lo tarificamos.
Permitido de serie
- Enriquecer sus propios registros y los de sus clientes
- Entrenar modelos y vender las puntuaciones, clasificaciones y veredictos
- Impulsar búsquedas y funcionalidades dentro de su producto
- Publicar conclusiones agregadas, estudios e informes
Lo que construya le pertenece. Comprar un dataset le da la licencia, no la base de datos subyacente.
Empezar con all-dataEnviar filas en bruto requiere un acuerdo
- Revender o redistribuir los datasets en bruto, en su totalidad o en gran parte
- Sublicenciar el export a terceros
La redistribución de datos en bruto es un negocio distinto, y lo tarificamos como tal. Eso es precisamente lo que mantiene el archivo tan barato para todos los demás. Los derechos de redistribución personalizados son negociables.
Hablar con ventasLa prueba de una sola pregunta: ¿está vendiendo nuestras filas o está vendiendo lo que ha hecho con ellas? La segunda opción no necesita permiso. El texto completo está en los términos.
Qué efecto tiene esto en su coste de ventas
El precio de enriquecimiento por uso crece con su volumen, así que su margen se reduce justo cuando tiene éxito. Un archivo plano no tiene ese problema.
Su partida de datos se redondea a cero
A €1,46 por millón de registros completos, el coste de los datos subyacentes deja de ser una partida que merezca la pena optimizar.
El coste deja de depender del uso
Su margen ya no se reduce cuando el producto crece. El archivo cuesta lo mismo tanto si lo consulta una vez como mil millones de veces.
Empiece más pequeño si lo prefiere
all-active-domains cuesta €29 por el espacio de nombres completo. Valide el pipeline y después tome todas las columnas.
Encaja donde ya viven sus datos
Un archivo JSON con un objeto por línea, en compresión estándar. Sin SDK, sin formato propietario, sin cliente de proveedor.
jq y shell
Transmita el archivo en streaming y fíltrelo. Nunca tiene que escribirlo entero en disco.
DuckDB y ClickHouse
Ambos leen JSON delimitado por saltos de línea directamente, compresión incluida. Declare las columnas para evitar la inferencia de tipos en las filas anchas.
Spark y pandas
Lectores JSONL estándar. En bloques o en streaming, el esquema es el mismo en cada línea.
BigQuery
BigQuery carga NDJSON sin comprimir, así que descomprima el archivo al importarlo o guárdelo antes en el almacenamiento.
Polars y Arrow
Escanee el archivo en modo diferido y filtre antes de que nada se materialice. Pase el resultado directamente a Arrow.
Snowflake y Databricks
Ambos ingieren JSON delimitado por saltos de línea desde el almacenamiento de objetos. Guarde el archivo una vez y después apunte un stage o un volumen hacia él.
Las preguntas que los ingenieros realmente hacen
Respondidas sin rodeos.
¿Es el esquema estable entre exportaciones?
Sí, las claves y su significado se mantienen estables en cada reconstrucción diaria, y están documentadas. Vale la pena conocer dos formas antes de escribir el parser. Technologies llega como una lista de nombres, o como un mapa de nombre a versión cuando hemos detectado versiones. Los campos vacíos llegan como null en lugar de omitirse, así que cada línea tiene las mismas claves.
¿Cómo de actualizado está?
Cada dataset se reconstruye a diario. El acceso incluye un mes natural de descargas repetidas, así que puede obtener la exportación más reciente tantas veces como su pipeline lo necesite.
¿Puedo incluir esto en un producto que vendo?
Sí. El enriquecimiento, las puntuaciones, las clasificaciones, las búsquedas y las conclusiones agregadas son suyos para vender. Revender las filas en bruto requiere un acuerdo de redistribución por escrito. Consulte el reparto de licencia anterior.
Qué contienen los registros, y qué no
Registros públicos de registro, DNS y tecnología. Sin datos personales de contacto, así que sin nombres de titulares, sin correos electrónicos, sin números de teléfono. Es una decisión de diseño deliberada, y es lo que hace que el archivo sea seguro para incluir dentro de un producto que venda.
¿Tengo que descargar 30 GB para probarlo?
No. Cada dataset tiene una muestra gratuita de 10.000 filas sin necesidad de cuenta. La API bearer incluida también sirve un fragmento por TLD, país o tecnología a la vez, a 240 solicitudes por minuto.
Ejecute una receta con 10.000 filas reales
Sin cuenta, sin correo electrónico. Si la muestra se procesa sin errores en su pipeline, el export completo cuesta €599 y el esquema no cambia.