Інструкції

Як завантажити список усіх зареєстрованих доменів

Поділитися

Усі зареєстровані домени інтернету в одному файлі — ось що вам насправді потрібно, і практичний спосіб отримати це рівно один. Не зразок, не одне розширення, не парсер, який помирає на першому ж ліміті запитів. Вам потрібен повний набір доменів по всіх TLD: чистий, актуальний і готовий до запитів. Ось як його отримати і чому збирати його самотужки — пастка.

Наскільки великий список усіх зареєстрованих доменів?

Більший, ніж більшість очікує. Просто зараз по всіх TLD світу зареєстровано сотні мільйонів доменів, і це число змінюється щодня: зʼявляються нові імена, старі звільняються. Такий файл не тримають у таблиці, це серйозний датасет.

.com сам по собі перевалив за 160 мільйонів доменів, а це близько 40% усього простору імен. Додайте .net і .org, новіші розширення (.io, .ai, .xyz, .shop) та сотні національних кодів, і повна картина сягає сотень мільйонів окремих доменних імен. Саме через цей масштаб повний набір усіх доменів — один із найцінніших датасетів в інтернеті: він лежить в основі воронок продажів, захисту бренду, досліджень безпеки та ринкової аналітики. І саме тому ніхто не роздає його безкоштовно.

Питання про .com, з якого починають усі

Більшість тих, кому потрібні «всі домени», насправді починають із .com, бо .com — це і є ринок. Понад 160 мільйонів імен роблять його непорівнянним із будь-яким іншим розширенням, і будь-який серйозний план мусить врахувати його першим. Добра новина: коли у вас є повний набір, виділити його — це фільтр в один рядок. Кожен домен .com лежить у тому самому файлі, що й усі .net, .org та національні імена, тож ви робите зріз тієї миті, коли він потрібен, а довгий хвіст лишається на потім.

У цьому й різниця між експортом лише по .com і повним датасетом: коли повний набір у вас на руках, .com — це зріз, а не окремий проєкт. Вам не доведеться докуповувати .net наступного кварталу тільки тому, що перший файл покривав одне розширення.

Чому зібрати це самотужки не вийде

Єдиної головної реєстратури для всього не існує. Кожен TLD працює на інфраструктурі свого оператора, за власними правилами і у власному форматі, а переважна більшість узагалі не публікує придатного до роботи фіда. Зшити з них усіх повну, дедупліковану й актуальну картину — це не скрипт на вихідні, а постійна операція з даними, яку більшість команд починає, сильно недооцінює і тихо кидає через три місяці. Ті, хто дотискає, зрештою підтримують крихкі парсери, ганяються за змінами форматів у десятках реєстратур і пояснюють своїй команді, чому список доменів знову застарів на тиждень.

Саме ця проблема у webatla вже розвʼязана. Замість того щоб спалити квартал на сотні несумісних джерел і все одно лишитися з прогалинами, ви отримуєте один файл, у якому вже є кожен домен, що ми відстежуємо, з оновленням щодня.

Що робить набір повним і придатним до роботи

Купа сирих дампів з реєстратур — це не датасет, а домашнє завдання. Цінність у роботі, яка перетворює сотні розрізнених джерел на один файл, до якого справді можна робити запити. Саме це ви й купуєте:

  • Покриття — кожен TLD, від .com і .net до найменшого національного коду, в одному наборі. Нічого не бракує через те, що до якоїсь реєстратури було важко достукатися.
  • Дедуплікація — один чистий рядок на домен, без колізій від джерел, що перетинаються.
  • Нормалізація — єдина схема для всіх розширень, тож example.com і example.co.uk розбираються однаково.
  • Свіжість — перезбірка щодня, тож набір відображає домени, які існують сьогодні, а не минулого кварталу.

Це поєднання і є різницею між «формально дані в мене є» та «я можу відповісти на запитання ще до обіду».

Увесь набір в одному файлі

Повний датасет доменів webatla — це і є той самий список: кожен домен з усіх TLD, дедуплікований і нормалізований в один чистий файл, який перезбирається щодня. Жодних заявок, погоджень і паперів для кожної реєстратури: купуєте один раз і забираєте весь простір імен свіжим JSONL.

Це навмисно найдешевший і найбільший за обсягом продукт у нас, бо він — база, на якій будується решта: одна фіксована ціна, місяць завантажень і всі домени на вашому диску за хвилини, а не за місяці.

Як виглядає кожен рядок

Кожен рядок — це одне доменне імʼя, структуроване так, щоб ви могли фільтрувати й сегментувати сотні мільйонів записів без піднімання бази даних. Один рядок виглядає ось так просто:

{"domain": "example.com", "tld": "com", "suffix": "com", "domainType": "ICANN"}
Поле Приклад Навіщо
domain example.com сама реєстрація
tld com фільтр за TLD
suffix co.uk коректна робота з багаторівневими суфіксами
domainType ICANN відділити gTLD від приватних просторів імен

Базовий набір каже, які домени існують. Коли вам потрібен реєстраційний запис за кожним із них, тобто хто власник, коли домен створено і через якого реєстратора, покладіть зверху датасет RDAP & WHOIS. Для серверів імен додайте датасет DNS, а для того, на чому працює кожен сайт, Technologies. Той самий набір доменів, збагачений з будь-якого потрібного боку.

Робота з файлом такого розміру

Кожен датасет webatla постачається у форматі JSONL — один JSON-обʼєкт на рядок, єдиний формат, що масштабується до сотень мільйонів доменів. Він читається потоково, рядок за рядком, і одразу лягає в jq, pandas, DuckDB, BigQuery чи Spark, тож вам ніколи не треба вантажити весь файл у памʼять.

Відсортуйте всі розширення за кількістю доменів одним рядком jq:

cat domains.jsonl | jq -r .tld | sort | uniq -c | sort -rn | head

Витягніть самі лише домени .com в окремий файл:

jq -c 'select(.tld == "com")' domains.jsonl > com.jsonl

Або робіть запити до всього набору просто на місці через DuckDB, без бази і без індексів:

SELECT tld, count(*) AS domains
FROM 'domains.jsonl'
GROUP BY tld
ORDER BY domains DESC;

Один цей запит за секунди перетворює сирий файл на карту всього доменного ринку в розрізі розширень. На цих самих даних ми розібрали концентрацію DNS і реєстраторів та TLD, що найшвидше зростали в першому кварталі 2026.

Кому потрібен повний набір доменів

Команди, які купують повний набір доменів, працюють у найрізноманітніших галузях, але проблема в них одна: неповні дані тихо ламають роботу, а прогалини лишаються невидимими, доки щось не зламається далі по ланцюжку.

  • Продажі та go-to-market — оцінка загального доступного ринку точна лише тоді, коли рахується від усіх доменів. Відфільтруйте нішу в .com, національний код або технологічний слід, і ви працюєте з усім ринком, а не з його зрізом.
  • Бренд і торгові марки — знайдіть кожен домен із назвою вашого бренду в усіх розширеннях, і сплячий тайпсквот у .com спливе ще до того, як його пустять у діло.
  • Безпека та розвідка загроз — прочешіть увесь простір імен на фішингові патерни, підозрілі кластери серверів імен і нові домени-двійники, які неповний фід просто не побачить.
  • Домейн-інвестори та реєстратори — відстежуйте рух доменів по кожному розширенню в часі й помічайте, куди зміщується попит.
  • Команди даних і ML — навчайте й перевіряйте моделі на чистому дедуплікованому наборі справжніх доменних імен, а не на спарсеному зразку, який перекошує модель.

Усім їм потрібна та сама відправна точка: один повний і актуальний набір доменів, якому можна довіряти, а не застарілий експорт чи недороблений парсинг.

Справжня ціна неповного списку

Неповний список підводить мовчки, і саме цим він небезпечний. Цифра загального доступного ринку виглядає переконливо, доки ви не дізнаєтеся, що її порахували з частки доменів, які існують насправді. Перевірка бренду повертається чистою не тому, що двійників немає, а тому, що їх ніколи не було в даних. Модель навчається на перекошеній вибірці, і ніхто цього не помічає, доки прогнози тихо не попливуть.

Повнота — це весь сенс списку доменів, а не приємний бонус. Набір, у якому бракує національних кодів, або реєстрацій минулого тижня, або припаркованого довгого хвоста, перекошує кожен підрахунок і кожен збіг, побудований на ньому. Купити один авторитетний файл замість того, щоб зшивати фрагменти, і означає прибрати цю сліпу зону: один файл, усі домени, тож відповідь, яку ви отримуєте, справді правдива.

Від файлу до першої відповіді за хвилини

Ніякого ETL-проєкту перед тим, як почати отримувати користь. Ви відкриваєте один файл, наводите на нього jq чи DuckDB і одразу робите запити до всього доменного простору: рахуєте .com проти .net, виділяєте національний код або шукаєте бренд за шаблоном по всіх розширеннях за один прохід. Оскільки це звичайний JSONL, той самий файл годує Python-ноутбук, завдання у Spark чи завантаження в BigQuery без жодної конвертації. Відстань між покупкою даних і відповіддю на реальне запитання міряється хвилинами, а не спринтами. У цьому й практичний сенс купити набір одразу: щойно він приїхав, він уже працює, а ваш час іде на аналіз, а не на обвʼязку.

Завжди актуальний, ніколи не застарілий

Файл із доменами старіє швидко. Імена реєструються і звільняються щохвилини, тож піврічної давнини файл для будь-чого чутливого до часу — це переважно шум, а свіжі домени, які сигналять про запуск чи кампанію, застарілий набір пропускає першими. Тому датасет перезбирається щодня, а кожен експорт має версію за датою: ви завжди точно знаєте, що саме тримаєте в руках і коли цей зріз зробили. Якщо вам треба ловити зовсім нові реєстрації того самого дня, коли вони зʼявляються, датасет Domain Investor побудований саме навколо свіжих доменів у всіх розширеннях.

Часті запитання

Скільки всього зареєстрованих доменів? Сотні мільйонів по всіх розширеннях разом, і цифра змінюється щодня. .com сам по собі перевалив за 160 мільйонів, а це приблизно 40% від загальної кількості. Оскільки все постійно змінюється, працювати варто лише з датованим набором, який перезбирається щодня.

Чи можна завантажити самі лише домени .com? Так. Відфільтруйте повний датасет за tld == "com", і всі домени .com будуть в окремому файлі. .com із великим відривом найбільше розширення, тож файл буде чималий, але це саме фільтр, а не окрема покупка.

Чи є у файлі щось, крім .com? Так, .com — це просто найбільший зріз. Набір охоплює .net, .org, .io, .ai і всі інші розширення аж до найменшого національного коду, все в одному файлі.

Чи можна отримати лише щойно зареєстровані домени? Так, відфільтруйте за датою реєстрації або почніть із датасета Domain Investor, який зосереджений на свіжих реєстраціях по всіх TLD.

Який формат і наскільки свіжі дані? Чистий JSONL, один домен на рядок, перезбірка щодня і версія за датою. Ніяких застарілих історичних дампів.

Чи можна використовувати повний список комерційно? Так. Продажі, безпека, захист бренду, дослідження та функції продукту — це все звичайні сценарії. Одна фіксована ціна покриває місяць доступу для будь-чого, що ви будуєте на цих даних.

Скільки це коштує? Одна фіксована ціна за місяць доступу, без підписки. Актуальну цифру дивіться на сторінці тарифів. Це найдешевший спосіб покласти всі домени на свій диск.

Завантажте повний список

Перестаньте збирати домени інтернету по одній реєстратурі за раз, цей проєкт не закінчується ніколи. Завантажте повний датасет доменів webatla → і вже сьогодні матимете кожен зареєстрований домен у всіх TLD, і .com, і довгий хвіст, чистим актуальним JSONL. Або перегляньте всі датасети, щоб побачити, що ще можна нашарувати зверху. Не треба ганятися за реєстратурами і чекати погоджень: просто повний набір доменів, який працює з моменту, коли він приїхав. Це найшвидший шлях від «мені потрібні всі домени» до того, щоб вони справді у вас були.

Отримайте дані, на яких побудована ця стаття

Той самий JSONL, який ми використали для цієї статті, зі свіжими експортами щодня. Придбайте датасет, який його охоплює.

M
Marina
Дата-журналістка · webatla

Пише матеріали про дані на основі датасетів webatla: тренди доменів, поширення технологій і те, як будується індекс.

Читати далі