Enriqueça tudo o que contenha um domínio, a partir de um único ficheiro JSONL

409M domínios ativos com sinais de DNS, WHOIS, tecnologia e ranking, uma linha por domínio, reconstruídos diariamente. O export completo custa €599. Treine modelos, pontue os seus registos e lance o seu próprio produto de dados por cima.

Obtenha a amostra gratuita de 10K Ver all-data, €599

Posso construir um produto com isto? Ler a licença →

409M+domínios ativos, uma linha cada
€1,46por 1M de registos completos
32,5 GBum ficheiro JSONL por exportação
Diárioexportações reconstruídas, mesmo esquema

O seu pipeline, o nosso ficheiro

Quatro receitas sobre o esquema real. Cada chave abaixo é exatamente o que é incluído na exportação. Experimente primeiro qualquer uma delas com a amostra gratuita de 10 000 linhas.

DomainTLDDomain typeHTTP statusIP addressCountry by IPTechnologiesDNS recordsPR valueHarmonic valueRegistrarDomain creation dateDomain expiration dateRDAP/WHOIS Record

Uma lista de leads, diretamente do ficheiro

Cada site WordPress com um registo MX ativo, transmitido diretamente a partir da exportação. Nada é guardado em disco.

bash + jq
# Technologies ships as a list of names, or a name-to-version map.
# One line normalizes both shapes.
zstdcat webatla-all-data-2026-08-18.jsonl.zst |
jq -c 'def techs: (.Technologies // []) | if type == "object" then keys else . end;
   select(techs | index("WordPress"))
   | select((."DNS records" // {}) | has("MX"))
   | {domain: .Domain, tld: .TLD, rank: ."PR value"}' \
  > wordpress-with-mail.jsonl

Adoção de tecnologia por TLD

Agregue dados de 1431 TLD diretamente sobre o ficheiro, sem etapa de carregamento. O DuckDB lê o campo technology como JSON, portanto peça-lhe primeiro o tipo.

duckdb
SELECT "TLD", count(*) AS domains
FROM read_json('webatla-all-data-2026-08-18.jsonl.zst',
       format='newline_delimited', compression='zstd',
       columns={'TLD':'VARCHAR', 'Technologies':'JSON'})
WHERE list_contains(
        CASE json_type("Technologies")
          WHEN 'ARRAY'  THEN json_extract_string("Technologies", '$[*]')
          WHEN 'OBJECT' THEN json_keys("Technologies")
          ELSE []::VARCHAR[] END, 'WordPress')
GROUP BY "TLD" ORDER BY domains DESC LIMIT 20;

Enriqueça o seu CRM através da chave de domínio

Faça um LEFT JOIN dos seus próprios registos com a exportação. País, ranking e stack aparecem ao lado de cada linha que já tinha.

duckdb
SELECT c.*, w."Country by IP", w."PR value", w."Registrar"
FROM 'crm.csv' c
LEFT JOIN (
  SELECT "Domain", "Country by IP", "PR value", "Registrar"
  FROM read_json('webatla-all-data-2026-08-18.jsonl.zst',
         format='newline_delimited', compression='zstd',
         columns={'Domain':'VARCHAR', 'Country by IP':'VARCHAR',
                  'PR value':'DOUBLE', 'Registrar':'VARCHAR'})
) w ON lower(c.domain) = w."Domain";

Passagem com memória constante num portátil

Transmita todas as 409 807 815 linhas sem manter o ficheiro em RAM. Construa features, pontue-as e exporte-as.

python
import io, json, zstandard as zstd

with open("webatla-all-data-2026-08-18.jsonl.zst", "rb") as f:
    for line in io.TextIOWrapper(zstd.ZstdDecompressor().stream_reader(f)):
        r = json.loads(line)
        t = r.get("Technologies") or []
        names = list(t) if isinstance(t, dict) else t
        if "WordPress" in names and (r.get("DNS records") or {}).get("MX"):
            print(r["Domain"], r.get("Registrar"))

A receita um e a receita quatro são a mesma consulta em dois motores, e na mesma exportação devolvem as mesmas linhas. Verificar o mesmo filtro em duas ferramentas é a forma correta de validar qualquer pipeline que construa sobre isto.

Pode construir um produto com isto? Sim

A divisão honesta. Construa sobre os dados e venda o que construir. Enviar as linhas em bruto adiante é um negócio diferente, e cobramos por isso em conformidade.

Permitido por defeito

  • Enriquecer os seus próprios registos e os registos dos seus clientes
  • Treinar modelos e vender as pontuações, classificações e veredictos
  • Alimentar pesquisas e funcionalidades dentro do seu produto
  • Publicar análises agregadas, estudos e relatórios

Aquilo que constrói pertence-lhe. Comprar um dataset dá-lhe a licença, não a base de dados subjacente.

Começar com all-data

Enviar linhas em bruto requer um acordo

  • Revender ou redistribuir os datasets em bruto, na totalidade ou em grande parte
  • Sublicenciar o export a terceiros

A redistribuição em bruto é um negócio diferente e cobramos por isso em conformidade. É exatamente isso que mantém o ficheiro em si tão barato para todos os outros. Os direitos de redistribuição personalizados são negociáveis.

Falar com vendas

O teste de uma pergunta só: está a vender as nossas linhas ou está a vender aquilo que fez a partir delas? A segunda opção não precisa de autorização. O texto completo está nos termos.

O que isto faz ao seu custo de vendas

O preço de enriquecimento cobrado por utilização cresce com o seu volume, pelo que a sua margem diminui precisamente quando tem sucesso. Um ficheiro plano não tem esse problema.

all-data, exportação completa€599
registos na exportação409 807 815
novas descargas durante um mêsilimitado
faturação por pedidonenhum
409 807 815 ÷ €599 €1,46 / 1M registos

A sua rubrica de dados arredonda para zero

A €1,46 por milhão de registos completos, o custo dos dados subjacentes deixa de ser uma rubrica que valha a pena otimizar.

O custo deixa de acompanhar a utilização

A sua margem deixa de diminuir à medida que o produto cresce. O ficheiro custa o mesmo quer o consulte uma vez quer mil milhões de vezes.

Comece mais pequeno, se preferir

all-active-domains custa €29 pelo espaço de nomes completo. Valide o pipeline e, depois, leve todas as colunas.

Encaixa onde os seus dados já vivem

Um ficheiro JSON delimitado por quebras de linha, em compressão padrão. Sem SDK, sem formato proprietário, sem cliente de fornecedor.

jq e shell

Transmita o ficheiro em streaming e filtre-o. Nunca precisa de o escrever todo para o disco.

DuckDB e ClickHouse

Ambos leem JSON delimitado por quebras de linha diretamente, compressão incluída. Declare as colunas para evitar a inferência de tipos nas linhas largas.

Spark e pandas

Leitores JSONL padrão. Em blocos ou em streaming, o esquema é o mesmo em cada linha.

BigQuery

O BigQuery carrega NDJSON simples, por isso descomprima ao importar ou guarde primeiro o ficheiro no armazenamento.

Polars e Arrow

Analise o ficheiro em modo lazy e filtre antes que algo seja materializado. Passe o resultado diretamente para o Arrow.

Snowflake e Databricks

Ambos ingerem JSON delimitado por quebras de linha a partir do armazenamento de objetos. Guarde o ficheiro uma vez e depois aponte um stage ou um volume para ele.

As perguntas que os engenheiros realmente fazem

Respondidas sem rodeios.

O esquema é estável entre exportações?

Sim, as chaves e o seu significado mantêm-se estáveis entre reconstruções diárias, e estão documentados. Vale a pena conhecer duas formas antes de escrever o parser. Technologies chega como uma lista de nomes, ou como um mapa de nome para versão quando detetamos versões. Os campos vazios chegam como null em vez de serem omitidos, por isso cada linha tem as mesmas chaves.

Quão atualizado está?

Cada dataset é reconstruído diariamente. O acesso inclui um mês civil de novas descargas, para que possa obter a exportação mais recente tantas vezes quantas a sua pipeline quiser.

Posso incluir isto num produto que vendo?

Sim. O enriquecimento, os scores, as classificações, as pesquisas e as informações agregadas são todos seus para vender. Reenviar as linhas em bruto exige um acordo de redistribuição por escrito. Consulte o divisão de licença acima.

O que está nos registos, e o que não está

Registos públicos de registo, DNS e tecnologia. Sem dados pessoais de contacto, portanto sem nomes de titulares, sem emails, sem números de telefone. Trata-se de uma decisão de conceção deliberada, e é isso que torna o ficheiro seguro para colocar dentro de um produto que venda.

Tenho de descarregar 30 GB para o testar?

Não. Cada dataset tem uma amostra gratuita de 10 000 linhas, sem necessidade de conta. A API bearer incluída também serve um fragmento de cada vez por TLD, país ou tecnologia, a 240 pedidos por minuto.

Execute uma receita em 10 000 linhas reais

Sem conta, sem e-mail. Se a amostra for processada sem erros no seu pipeline, o export completo custa €599 e o esquema não muda.