인터넷에 등록된 모든 도메인을 파일 하나에 담는 것, 그것이 진짜 원하는 것이며 이를 손에 넣는 실질적인 방법은 단 하나뿐입니다. 샘플이 아니라, 단일 확장자가 아니라, 첫 요청 제한에서 멈춰버리는 스크래핑도 아닙니다. 모든 최상위 도메인(TLD)에 걸친 완전한 도메인 세트, 즉 깨끗하고 최신이며 바로 조회할 수 있는 데이터를 원하는 것입니다. 지금부터 그것을 손에 넣는 방법과, 직접 만드는 것이 왜 함정인지 설명합니다.
등록된 모든 도메인 목록의 규모는 어느 정도입니까?
대부분의 예상보다 훨씬 방대합니다. 지금 이 순간에도 전 세계 TLD에 걸쳐 수억 개의 도메인이 등록되어 있으며, 새로운 이름이 생기고 오래된 이름이 사라지면서 그 수는 매일 변합니다. 이는 스프레드시트에 담아둘 수 있는 파일이 아니라, 본격적인 데이터셋입니다.
.com만 해도 1억 6,000만 개를 넘어섰습니다. 전체 네임스페이스의 약 40%를 .com 하나가 차지하는 셈입니다. 여기에 .net과 .org, 그리고 .io, .ai, .xyz, .shop 같은 신규 확장자, 나아가 수백 개에 이르는 국가 코드까지 더하면 전체 규모는 수억 개의 개별 도메인 이름에 이릅니다. 바로 이 규모 때문에 모든 도메인을 아우르는 완전한 세트는 인터넷에서 가장 가치 있는 데이터셋 중 하나로 꼽히며, 영업 파이프라인, 브랜드 보호, 보안 리서치, 시장 인텔리전스의 기반이 됩니다. 그리고 이것이 누구도 이를 공짜로 내놓지 않는 이유이기도 합니다.
모두가 .com부터 시작하는 질문
「모든 도메인」을 원하는 사람 대부분은 사실 .com에서 출발합니다. .com이 곧 시장이기 때문입니다. 1억 6,000만 개가 넘는 이름으로 다른 모든 확장자를 압도하므로, 진지한 계획이라면 반드시 이것부터 다뤄야 합니다. 좋은 소식은, 완전한 세트를 확보하고 나면 .com만 걸러내는 일은 한 줄짜리 필터로 끝난다는 점입니다. 모든 .com 도메인은 모든 .net, .org, 국가 코드 도메인과 같은 파일 안에 들어 있으므로, 필요한 순간 바로 잘라내고 나머지 롱테일은 나중을 위해 남겨두면 됩니다.
이것이 .com 전용 익스포트와 완전한 데이터셋의 차이입니다. 전체 세트를 손에 쥐고 있으면 .com은 하나의 뷰일 뿐, 별도의 프로젝트가 아닙니다. 처음 받은 파일이 확장자 하나만 다뤘다는 이유로 다음 분기에 .net을 다시 구매할 일도 없습니다.
직접 조립할 수 없는 이유
모든 것을 아우르는 단일 마스터 레지스트리는 존재하지 않습니다. 각 TLD는 저마다의 운영 주체가 만든 인프라 위에서, 저마다의 규칙과 형식으로 운영되며, 대다수는 사용할 만한 피드조차 아예 공개하지 않습니다. 이 모든 것을 완전하고 중복 없이 최신 상태로 하나로 엮어내는 일은 주말에 뚝딱 만드는 스크립트가 아니라 상시 운영해야 하는 데이터 작업입니다. 대부분의 팀은 이를 가볍게 시작했다가 난이도를 크게 과소평가하고, 석 달쯤 지나 조용히 포기합니다. 끝까지 밀어붙인 팀도 결국 부서지기 쉬운 스크래퍼를 유지보수하고, 수십 개 레지스트리에서 수시로 바뀌는 형식을 쫓아다니며, 도메인 목록이 또 일주일이나 뒤처진 이유를 팀에 설명하는 처지가 됩니다.
바로 이 문제를 webatla가 이미 해결해두었습니다. 수백 개의 호환되지 않는 소스를 쫓아다니며 한 분기를 허비하고도 결국 빈틈이 남는 대신, 저희가 추적하는 모든 도메인을 이미 담고 있으며 매일 새로 고침되는 파일 하나를 받으시면 됩니다.
완전하고 실사용 가능한 세트를 만드는 요소
가공되지 않은 레지스트리 덤프 더미는 데이터셋이 아니라 숙제에 가깝습니다. 진짜 가치는 수백 개의 파편화된 소스를 실제로 조회 가능한 파일 하나로 바꾸는 작업 자체에 있으며, 바로 그 작업을 구매하시는 것입니다.
- 커버리지:
.com,.net부터 가장 작은 국가 코드까지 모든 TLD를 하나의 세트에 담습니다. 특정 레지스트리에 접근하기 어렵다는 이유로 빠지는 항목은 없습니다. - 중복 제거: 도메인마다 깨끗한 행이 하나씩 존재하며, 소스가 겹쳐서 생기는 충돌이 없습니다.
- 정규화: 모든 확장자에 걸쳐 일관된 스키마를 적용해
example.com과example.co.uk가 동일한 방식으로 파싱됩니다. - 최신성: 매일 재구축되어 지난 분기가 아니라 오늘 실제로 존재하는 도메인을 그대로 반영합니다.
이 조합이 바로 「기술적으로는 데이터를 갖고 있다」와 「점심시간 전에 이 데이터로 질문에 답할 수 있다」의 차이를 만듭니다.
파일 하나에 담긴 전체 세트
webatla의 전체 도메인 데이터셋이 바로 그 목록 자체입니다. 모든 TLD에 걸친 모든 도메인이 중복 제거와 정규화를 거쳐 하나의 깨끗한 파일로 매일 재구축됩니다. 신청도, 승인도, 레지스트리별 서류 작업도 필요 없습니다. 한 번 구매하면 전체 네임스페이스를 최신 JSONL로 그대로 받으실 수 있습니다.
이 제품은 저희가 판매하는 상품 중 의도적으로 가장 저렴하면서도 데이터 양은 가장 많은 상품입니다. 다른 모든 것이 이 위에 쌓이는 기반이기 때문입니다. 단일 정액 요금, 한 달간의 다운로드, 그리고 몇 달이 아니라 몇 분 만에 디스크에 담기는 모든 도메인, 이것이 전부입니다.
각 줄의 구성
각 줄은 도메인 이름 하나이며, 별도의 데이터베이스를 구축하지 않고도 수억 건의 레코드를 필터링하고 세그먼트할 수 있도록 구조화되어 있습니다. 한 행은 다음처럼 단순합니다.
{"domain": "example.com", "tld": "com", "suffix": "com", "domainType": "ICANN"}
| 필드 | 예시 | 용도 |
|---|---|---|
domain |
example.com |
등록 자체 |
tld |
com |
TLD별 필터링 |
suffix |
co.uk |
다단계 접미사를 올바르게 처리 |
domainType |
ICANN |
gTLD와 사설 네임스페이스를 구분 |
기본 세트는 어떤 도메인이 존재하는지 알려줍니다. 각 도메인 뒤에 있는 등록 정보, 즉 소유자가 누구인지, 언제 생성되었는지, 어느 레지스트라를 통했는지가 필요하다면 RDAP & WHOIS 데이터셋을 함께 사용하십시오. 네임서버 정보가 필요하면 DNS 데이터셋을, 각 사이트가 무엇으로 운영되는지 알고 싶다면 Technologies를 추가하시면 됩니다. 동일한 도메인 세트를 원하는 각도에서 얼마든지 보강할 수 있습니다.
이만큼 큰 파일을 다루는 방법
모든 webatla 데이터셋은 JSONL 형식으로 제공됩니다. 한 줄에 JSON 객체 하나씩, 수억 개의 도메인을 다룰 수 있는 유일한 형식입니다. 줄 단위로 스트리밍되어 jq, pandas, DuckDB, BigQuery, Spark에 그대로 흘려 넣을 수 있으므로 파일 전체를 메모리에 올릴 필요가 없습니다.
jq 한 줄로 모든 확장자를 도메인 수 기준으로 순위를 매길 수 있습니다.
cat domains.jsonl | jq -r .tld | sort | uniq -c | sort -rn | head
.com 도메인만 별도 파일로 뽑아낼 수도 있습니다.
jq -c 'select(.tld == "com")' domains.jsonl > com.jsonl
또는 DuckDB로 전체 세트를 그 자리에서 바로 쿼리할 수 있습니다. 데이터베이스도, 인덱스도 필요 없습니다.
SELECT tld, count(*) AS domains
FROM 'domains.jsonl'
GROUP BY tld
ORDER BY domains DESC;
이 쿼리 한 번으로 원본 파일이 몇 초 만에 확장자별 전체 도메인 시장 지도로 바뀝니다. 저희는 같은 데이터를 활용해 DNS 및 레지스트라 집중도와 2026년 1분기 가장 빠르게 성장한 TLD를 분석한 바 있습니다.
완전한 도메인 세트에 의존하는 사람들
전체 도메인 세트를 구매하는 팀은 업종을 가리지 않지만, 공통된 문제 하나를 안고 있습니다. 불완전한 데이터가 조용히 작업을 망가뜨리고, 그 빈틈은 나중에 무언가 잘못될 때까지 드러나지 않는다는 점입니다.
- 영업 및 시장 진출: 전체 시장 규모(TAM) 산정은 모든 도메인에서 출발해야만 정확합니다.
.com틈새 시장, 국가 코드, 기술 스택으로 필터링해도 시장의 일부가 아니라 전체 시장을 대상으로 영업할 수 있습니다. - 브랜드 및 상표 관리 팀: 모든 확장자에서 브랜드명을 포함한 도메인을 전부 찾아내면, 잠들어 있던
.com오타스쿼팅이 악용되기 전에 먼저 드러납니다. - 보안 및 위협 인텔리전스: 전체 네임스페이스를 훑어 피싱 패턴, 의심스러운 네임서버 클러스터, 부분 피드로는 놓칠 새로운 유사 도메인을 찾아냅니다.
- 도메인 투자자 및 레지스트라: 확장자별 도메인 이동을 시간에 따라 추적하고 수요가 옮겨가는 지점을 포착합니다.
- 데이터 및 ML 팀: 모델을 왜곡시키는 스크래핑 표본이 아니라, 깨끗하고 중복 제거된 실제 도메인 이름 세트로 학습과 평가를 진행합니다.
이들 모두에게 필요한 출발점은 동일합니다. 오래된 익스포트나 미완성 스크래핑이 아니라, 신뢰할 수 있는 완전하고 최신인 도메인 세트 하나입니다.
불완전한 목록이 초래하는 실질적 비용
불완전한 목록은 조용히 실패하며, 바로 그 점이 위험한 이유입니다. 전체 시장 규모 수치는 실제 존재하는 도메인 중 일부만으로 만들어졌다는 사실을 알기 전까지는 그럴듯해 보입니다. 브랜드 스캔 결과가 깨끗하게 나오는 이유는 유사 도메인이 없어서가 아니라, 데이터 안에 애초에 존재하지 않았기 때문인 경우가 많습니다. 모델은 편향된 표본으로 학습되고, 예측이 조용히 어긋나기 시작할 때까지 아무도 알아차리지 못합니다.
완전성은 도메인 목록에서 있으면 좋은 요소가 아니라 그 자체가 목적입니다. 국가 코드나 지난주 등록분, 파킹된 롱테일이 빠진 세트는 그 위에서 계산되는 모든 카운트와 매칭을 왜곡시킵니다. 파편을 이어 붙이는 대신 권위 있는 파일 하나를 구매하는 것이야말로 이런 사각지대를 없애는 방법입니다. 파일 하나, 모든 도메인, 그래서 얻는 답이 실제로 참인 답이 됩니다.
파일에서 첫 답까지, 단 몇 분
가치를 얻기 전에 별도의 ETL 프로젝트를 돌릴 필요가 없습니다. 파일 하나를 열고 jq나 DuckDB를 겨냥하면 곧바로 전체 도메인 네임스페이스를 조회할 수 있습니다. .com과 .net의 수를 비교하거나, 국가 코드를 분리하거나, 한 번의 패스로 모든 확장자에서 브랜드를 패턴 매칭할 수 있습니다. 평범한 JSONL이므로 같은 파일이 변환 없이 그대로 Python 노트북, Spark 작업, BigQuery 적재로 흘러 들어갑니다. 데이터를 구매하는 것과 실제 질문에 답하는 것 사이의 간격은 스프린트가 아니라 분 단위로 측정됩니다. 이것이 세트를 통째로 구매하는 실질적인 이유입니다. 도착하는 순간 이미 작업을 시작하고, 여러분의 시간은 배관 작업이 아니라 분석에 쓰입니다.
항상 최신, 결코 낡지 않습니다
도메인 파일은 빠르게 낡습니다. 매 순간 도메인이 등록되고 사라지므로, 6개월 전 파일은 시간에 민감한 용도라면 대부분 잡음에 불과합니다. 그리고 런칭이나 캠페인을 알려주는 신규 도메인이야말로 오래된 세트가 놓치는 바로 그 대상입니다. 그래서 이 데이터셋은 매일 재구축되고, 모든 익스포트에는 날짜 버전이 매겨집니다. 지금 손에 든 데이터가 정확히 무엇이고 언제 잘라낸 것인지 항상 알 수 있습니다. 새로 등록된 도메인을 나오는 그날 바로 포착하는 것이 목적이라면, Domain Investor 데이터셋이 모든 확장자에 걸친 신규 도메인을 중심으로 설계되어 있습니다.
자주 묻는 질문
등록된 도메인은 총 몇 개입니까?
모든 확장자를 합쳐 수억 개에 달하며, 그 수치는 매일 변합니다. .com만 해도 1억 6,000만 개를 넘어섰고, 이는 전체의 약 40%에 해당합니다. 끊임없이 바뀌기 때문에 날짜가 찍히고 매일 재구축되는 세트만이 실제로 작업할 가치가 있는 버전입니다.
.com 도메인만 따로 다운로드할 수 있습니까?
가능합니다. 전체 데이터셋을 tld == "com" 조건으로 필터링하면 모든 .com 도메인이 별도 파일로 만들어집니다. .com은 압도적인 차이로 가장 큰 확장자이므로 파일 크기도 클 것으로 예상하십시오. 다만 이것은 필터링일 뿐, 별도 구매가 아닙니다.
파일에는 .com 외에 다른 것도 포함되어 있습니까?
포함되어 있습니다. .com은 그중 가장 큰 조각일 뿐입니다. 이 세트는 .net, .org, .io, .ai부터 가장 작은 국가 코드에 이르기까지 모든 확장자를 하나의 파일 안에 아우릅니다.
신규 등록 도메인만 받을 수 있습니까? 가능합니다. 등록일로 필터링하시거나, TLD 전반의 신규 등록에 초점을 맞춘 Domain Investor 데이터셋에서 시작하십시오.
형식은 무엇이며, 얼마나 최신입니까? 깨끗한 JSONL 형식으로 한 줄에 도메인 하나씩 담겨 있으며, 매일 재구축되고 날짜별로 버전이 매겨집니다. 낡은 과거 덤프가 아닙니다.
전체 목록을 상업적으로 사용할 수 있습니까? 가능합니다. 영업, 보안, 브랜드 보호, 리서치, 제품 기능 개발 모두 일반적인 사용 사례입니다. 단일 정액 요금으로 한 달간 접근이 가능하며, 이 데이터 위에 무엇을 구축하시든 상관없습니다.
비용은 얼마입니까? 구독 없이, 한 달 접근에 대한 단일 정액 요금입니다. 현재 가격은 가격 정책 페이지에서 확인하십시오. 모든 도메인을 디스크에 담는 가장 저렴한 방법입니다.
전체 목록 다운로드
인터넷의 도메인을 레지스트리 하나씩 직접 재조립하려는 시도는 이제 그만두십시오. 결코 끝나지 않는 프로젝트입니다. webatla의 전체 도메인 데이터셋 다운로드 → .com부터 롱테일까지 모든 TLD에 걸친 모든 등록 도메인을 오늘 당장 깨끗하고 최신인 JSONL로 받아보십시오. 그 위에 더할 수 있는 모든 것을 보려면 전체 데이터셋 둘러보기도 확인하십시오. 쫓아다닐 레지스트리도, 기다릴 승인도 없습니다. 도착하는 순간 바로 작동하는 완전한 도메인 세트뿐입니다. 「모든 도메인이 필요하다」에서 실제로 그것을 손에 넣기까지, 가장 빠른 길입니다.