도메인이 들어 있는 것이라면 무엇이든, JSONL 파일 하나로 강화합니다

410M건의 활성 도메인을 대상으로 DNS, WHOIS, 기술 정보, 순위 시그널을 한 행씩, 매일 재구축해 제공합니다. 전체 내보내기는 €599입니다. 모델을 학습시키고, 레코드에 점수를 매기고, 그 위에 자체 데이터 프로덕트를 만들어 보십시오.

무료 1만 건 샘플 받기 all-data 데이터셋 보기, €599

이것으로 프로덕트를 만들 수 있습니까? 라이선스 확인하기 →

410M+활성 도메인, 건당 1행
€1.46완전한 레코드 100만 건당
32,7 GB내보내기당 JSONL 파일 1개
매일내보내기 재구성, 스키마는 동일

고객의 파이프라인, 저희 파일

실제 스키마를 기반으로 한 네 가지 레시피입니다. 아래의 각 키는 내보내기에 실제로 포함되는 것과 정확히 일치합니다. 먼저 무료 10,000행 샘플로 하나를 시도해 보십시오.

DomainTLDDomain typeHTTP statusIP addressCountry by IPTechnologiesDNS recordsPR valueHarmonic valueRegistrarDomain creation dateDomain expiration dateRDAP/WHOIS Record

파일에서 바로 만드는 리드 리스트

유효한 MX 레코드를 가진 모든 WordPress 사이트를 내보내기에서 바로 스트리밍합니다. 디스크에는 아무것도 기록되지 않습니다.

bash + jq
# Technologies ships as a list of names, or a name-to-version map.
# One line normalizes both shapes.
zstdcat webatla-all-data-2026-08-22.jsonl.zst |
jq -c 'def techs: (.Technologies // []) | if type == "object" then keys else . end;
   select(techs | index("WordPress"))
   | select((."DNS records" // {}) | has("MX"))
   | {domain: .Domain, tld: .TLD, rank: ."PR value"}' \
  > wordpress-with-mail.jsonl

TLD별 기술 도입 현황

1,431개 TLD에 걸쳐 로드 처리 없이 파일에서 직접 집계합니다. DuckDB 엔진은 technology 필드를 JSON으로 읽으므로, 먼저 타입을 확인하십시오.

duckdb
SELECT "TLD", count(*) AS domains
FROM read_json('webatla-all-data-2026-08-22.jsonl.zst',
       format='newline_delimited', compression='zstd',
       columns={'TLD':'VARCHAR', 'Technologies':'JSON'})
WHERE list_contains(
        CASE json_type("Technologies")
          WHEN 'ARRAY'  THEN json_extract_string("Technologies", '$[*]')
          WHEN 'OBJECT' THEN json_keys("Technologies")
          ELSE []::VARCHAR[] END, 'WordPress')
GROUP BY "TLD" ORDER BY domains DESC LIMIT 20;

도메인 키를 통한 CRM 보강

내보내기에 자체 레코드를 LEFT JOIN하십시오. 국가, 순위, 스택이 이미 가지고 있던 각 행 옆에 추가됩니다.

duckdb
SELECT c.*, w."Country by IP", w."PR value", w."Registrar"
FROM 'crm.csv' c
LEFT JOIN (
  SELECT "Domain", "Country by IP", "PR value", "Registrar"
  FROM read_json('webatla-all-data-2026-08-22.jsonl.zst',
         format='newline_delimited', compression='zstd',
         columns={'Domain':'VARCHAR', 'Country by IP':'VARCHAR',
                  'PR value':'DOUBLE', 'Registrar':'VARCHAR'})
) w ON lower(c.domain) = w."Domain";

노트북에서의 고정 메모리 처리

410,346,346행 전체를 파일을 RAM에 유지하지 않고 스트리밍합니다. 특징을 만들고, 점수를 매기고, 결과를 기록합니다.

python
import io, json, zstandard as zstd

with open("webatla-all-data-2026-08-22.jsonl.zst", "rb") as f:
    for line in io.TextIOWrapper(zstd.ZstdDecompressor().stream_reader(f)):
        r = json.loads(line)
        t = r.get("Technologies") or []
        names = list(t) if isinstance(t, dict) else t
        if "WordPress" in names and (r.get("DNS records") or {}).get("MX"):
            print(r["Domain"], r.get("Registrar"))

레시피 1과 레시피 4는 두 엔진에서 실행되는 동일한 쿼리이며, 동일한 내보내기에 대해 동일한 행을 반환합니다. 하나의 필터를 두 도구에서 서로 대조해 확인하는 것이, 이를 기반으로 구축하는 모든 파이프라인을 검증하는 방법입니다.

이것으로 프로덕트를 만들 수 있습니까? 네

정직한 구분입니다. 데이터 위에 프로덕트를 구축하고, 만든 것을 판매하십시오. 원본 데이터의 행을 그대로 전달하는 것은 별개의 사업이며, 저희는 그에 맞게 가격을 책정합니다.

처음부터 허용됩니다

  • 자사 레코드와 고객 레코드를 강화하는 것
  • 모델을 학습시키고 점수, 분류, 판정 결과를 판매하는 것
  • 자사 프로덕트 안의 룩업과 기능을 뒷받침하는 것
  • 집계한 인사이트와 조사, 리포트를 공개하는 것

만든 것에 대한 권리는 여러분의 것입니다. 데이터셋을 구매하면 얻는 것은 라이선스이며, 그 바탕이 되는 데이터베이스 자체가 아닙니다.

all-data 데이터셋으로 시작하기

원본 데이터의 행을 전달하려면 계약이 필요합니다

  • 원본 데이터셋 전체 또는 상당 부분을 재판매하거나 재배포하는 것
  • 내보내기를 제3자에게 서브라이선스하는 것

원본 데이터 재배포는 별개의 사업이며, 저희는 그에 맞게 가격을 책정하고 있습니다. 바로 그 덕분에 파일 자체를 다른 모든 분들께 이렇게 저렴하게 유지할 수 있습니다. 맞춤 재배포 권리는 협의가 가능합니다.

영업팀에 문의하기

질문은 단 하나입니다. 저희의 행 자체를 판매하는 것인지, 아니면 그 행으로 만든 결과물을 판매하는 것인지입니다. 후자라면 별도 허가가 필요 없습니다. 정확한 조항은 이용약관에 나와 있습니다.

이것이 매출원가(COGS)에 미치는 영향

종량제 데이터 보강 요금은 사용량에 비례해 증가하므로, 성공할수록 마진이 줄어듭니다. 플랫 파일에는 이런 문제가 없습니다.

all-data, 전체 내보내기€599
내보내기에 포함된 건수410,346,346
1개월간 재다운로드무제한
요청당 과금없음
410,346,346 ÷ €599 €1.46 / 100만 건

데이터 비용이 사실상 0이 됩니다

완전한 레코드 100만 건당 가격이 €1.46이면, 기반 데이터의 비용은 더 이상 최적화할 가치가 있는 항목이 아닙니다.

비용이 더 이상 사용량에 연동되지 않습니다

제품이 성장해도 마진이 줄어드는 일은 더 이상 없습니다. 파일은 한 번 조회하든 10억 번 조회하든 요금이 동일합니다.

원하신다면 더 작게 시작할 수도 있습니다

all-active-domains 데이터셋은 전체 네임스페이스 기준으로 €29입니다. 먼저 파이프라인을 검증한 후 모든 열을 가져오십시오.

이미 데이터가 있는 곳에 그대로 들어맞습니다

줄바꿈으로 구분된 JSON 파일 1개를 표준 압축 형식으로 제공합니다. SDK도, 독자적인 형식도, 벤더 전용 클라이언트도 필요 없습니다.

jq와 쉘

파일을 스트리밍하면서 필터링합니다. 전체를 디스크에 쓸 필요가 전혀 없습니다.

DuckDB와 ClickHouse

둘 다 압축된 상태 그대로 줄바꿈 구분 JSON을 직접 읽습니다. 열을 선언하면 폭넓은 행에서 타입 추론을 건너뛸 수 있습니다.

Spark와 pandas

표준 JSONL 리더입니다. 청크로 나누든 스트림으로 읽든, 스키마는 모든 행에서 동일합니다.

BigQuery

BigQuery 가져오기는 무압축 NDJSON만 지원하므로, 들어오는 과정에서 압축을 해제하거나 파일을 먼저 스토리지에 저장해야 합니다.

Polars · Arrow

파일을 지연 평가 방식으로 스캔하고, 무엇이든 구체화되기 전에 필터링합니다. 결과는 그대로 Arrow 형식으로 전달하면 됩니다.

Snowflake · Databricks

두 시스템 모두 오브젝트 스토리지에서 줄바꿈으로 구분된 JSON을 가져올 수 있습니다. 파일을 한 번만 두고 나서 스테이지나 볼륨을 그 위치로 지정하면 됩니다.

엔지니어가 실제로 묻는 질문

얼버무리지 않고 답합니다.

스키마는 내보내기 간에도 안정적입니까?

네, 키와 그 의미는 매일 이루어지는 재구축 전반에 걸쳐 그대로 유지되며, 문서로 정리되어 있습니다. 파서를 작성하기 전에 알아 두어야 할 형태가 두 가지 있습니다. Technologies 필드는 이름 목록으로 오거나, 버전을 감지한 경우에는 이름과 버전을 매핑한 형태로 옵니다. 값이 없는 필드는 생략되지 않고 null 값으로 오기 때문에, 모든 행이 동일한 키를 가집니다.

데이터는 얼마나 최신입니까?

모든 데이터셋은 매일 재구축됩니다. 접근 권한에는 역월 기준 1개월간의 재다운로드가 포함되어 있어, 파이프라인이 필요로 하는 만큼 자주 최신 내보내기를 받아볼 수 있습니다.

이것을 제가 판매하는 프로덕트에 포함할 수 있습니까?

네. 엔리치먼트, 점수, 분류, 룩업, 집계 인사이트는 모두 판매할 수 있습니다. 원본 행 데이터를 그대로 제공하려면 서면 재배포 계약이 필요합니다. 위의 라이선스 구분 방식 링크를 참조하십시오.

레코드에 포함된 것과 포함되지 않은 것

공개 등록 정보, DNS, 기술 기록입니다. 연락처 개인정보는 포함되지 않으므로 등록자 이름, 이메일 주소, 전화번호가 없습니다. 이는 의도적인 설계 결정이며, 바로 그 점이 이 파일을 판매용 제품에 안전하게 포함할 수 있게 만듭니다.

테스트하려면 30GB를 다운로드해야 합니까?

아니요. 모든 데이터셋에는 계정 없이 이용할 수 있는 무료 10,000행 샘플이 제공됩니다. 포함된 bearer API 역시 TLD, 국가, 기술 중 한 가지 슬라이스를 한 번에, 분당 240건의 요청으로 제공합니다.

실제 데이터 10,000 행으로 레시피 실행

계정도 이메일도 필요 없습니다. 샘플이 파이프라인에서 문제없이 파싱되면, 전체 익스포트 비용은 €599입니다. 스키마도 변경되지 않습니다.