Перепис інтернету, що вкладається в дослідницький бюджет

Уся сукупність активних доменів, а не вибірка. 409M доменів із даними DNS, технологіями та рейтингом в одному файлі, який можна виміряти, процитувати й перерахувати заново. Стартовий перепис коштує €29. Безкоштовний зразок на 10 000 рядків не потребує облікового запису.

Отримати безкоштовний зразок на 10K рядків Переглянути перепис за €29

Чи можна публікувати отримані результати? →

409Mуся сукупність, а не вибірка
€29стартовий перепис, один платіж
З датоюфіксований зріз, який можна цитувати
10Kбезкоштовних рядків зразка, без облікового запису

Вимірюйте весь веб, а не вибірку з нього

Чотири агрегувальні рецепти на реальній схемі. Перший працює на переписі за €29. Решта використовують all-data, коли для питання потрібно більше колонок.

DomainTLDDomain typeCountry by IPTechnologiesDNS StatusPR valueHarmonic valueDomain creation date

Домени за TLD, увесь перепис

Найпростіший показник по всій сукупності, і він працює на стартовому наборі за €29. Порахуйте всі активні домени за TLD.

bash + jq
zstdcat webatla-all-active-domains-2026-08-17.jsonl.zst |
jq -r '.TLD' |
sort | uniq -c | sort -rn > domains-by-tld.txt

Поширеність технологій у всій сукупності

Скільки сайтів використовують кожну технологію, підрахунок по всьому файлу. Поле технологій має дві форми, тому розгалужуйте обробку за його типом у JSON.

duckdb
WITH t AS (
  SELECT CASE json_type("Technologies")
           WHEN 'ARRAY'  THEN json_extract_string("Technologies", '$[*]')
           WHEN 'OBJECT' THEN json_keys("Technologies")
           ELSE []::VARCHAR[] END AS techs
  FROM read_json('webatla-all-data-2026-08-17.jsonl.zst',
       format='newline_delimited', compression='zstd',
       columns={'Technologies':'JSON'})
)
SELECT tech, count(*) AS sites
FROM t, unnest(t.techs) AS u(tech)
GROUP BY tech ORDER BY sites DESC LIMIT 25;

Де розміщено вебсайти

Розподіл доменів за країною хостингу, визначений за IP. Одне групування в один рядок по всьому експорту.

duckdb
SELECT "Country by IP" AS country, count(*) AS domains
FROM read_json('webatla-all-data-2026-08-17.jsonl.zst',
       format='newline_delimited', compression='zstd',
       columns={'Country by IP':'VARCHAR'})
WHERE country IS NOT NULL
GROUP BY country ORDER BY domains DESC;

Яка частка простору імен відповідає в DNS

Відтворюване ключове число. Відсоток відстежуваних доменів, які зараз відповідають у DNS, прямо з файлу.

duckdb
SELECT "DNS Status" AS resolves, count(*) AS n,
       round(100.0*count(*)/sum(count(*)) OVER (), 2) AS pct
FROM read_json('webatla-all-data-2026-08-17.jsonl.zst',
       format='newline_delimited', compression='zstd',
       columns={'DNS Status':'VARCHAR'})
GROUP BY resolves ORDER BY n DESC;

Кожен рецепт працює і на зразку, і на повному файлі без жодних змін. Наводьте число, яке отримали, і посилайтеся на датований файл, з якого воно взялося.

Так, ви можете публікувати свої результати

Чесне розмежування для академічних і ринкових досліджень.

Публікуйте вільно

  • Агрегована статистика, таблиці, графіки та карти
  • Результати, методи та висновки у статті чи звіті
  • Кілька доменів як приклади, щоб проілюструвати тезу
  • Похідні показники та індекси, які ви обчислюєте

Робота належить вам. Посилайтеся на датасет і дату зрізу, щоб інші могли звірити свої числа з вашими.

Почніть з перепису

Передача сирих рядків потребує домовленості

  • Публікація сирого датасету як даних для відтворення чи додаткових матеріалів
  • Перерозповсюдження файлу цілком або його істотних частин

Це перерозповсюдження, і воно потребує письмової угоди. Якщо журнал вимагає відкритих даних для відтворення, напишіть нам. Ми радше допоможемо виконати цю вимогу, ніж залишимо вас без виходу.

Запитати про академічні умови

Чим це добре для досліджень

Це не чергове API, до якого доводиться робити застереження в розділі про методи.

Сукупність, а не вибірка

Ви вимірюєте кожен активний домен, який ми відстежуємо, тож ваш знаменник справжній. Немає основи вибірки, яку довелося б обґрунтовувати рецензентові.

Фіксований зріз, який можна цитувати

Кожен експорт має дату. Наведіть файл і дату, і будь-хто зможе запросити той самий зріз та відтворити вашу таблицю.

Наводьте точні числа

Скільки є, стільки й є. 409,870,541 доменів у цьому зрізі, а не оцінка, обмежена лімітом запитів, яка щоразу виходить іншою.

Вписується в рядок грантового бюджету

Стартовий перепис коштує €29, а всі дані разом €599. Це вкладається в більшість дисертаційних і кафедральних бюджетів без тендерної процедури.

Відкритий і нудний формат

Один файл, по одному обʼєкту JSON на рядок. Немає пропрієтарного зчитувача, який треба описувати в методах, і немає клієнта, який треба ставити на закритий компʼютер.

Лише публічні записи

Жодних контактних персональних даних: ні імен, ні електронних адрес, ні телефонів. Лише факти про реєстрацію, DNS і технології, тобто дані, які етична комісія пропускає без зайвих питань.

Питання, які поставить рецензент

Відповіді без викрутасів.

Це вся сукупність чи вибірка?

Уся сукупність активних доменів, які ми відстежуємо, 409,870,541 доменів у поточному зрізі. Це не вибірка, тож ваші коефіцієнти та частки рахуються від справжнього знаменника.

Як забезпечити відтворюваність?

Кожен експорт має дату в назві файлу. Посилайтеся на датасет і цю дату. Файл незмінний, тож той самий зріз дає ті самі числа на будь-якому компʼютері. Якщо комусь потрібен саме той зріз, який ви використали, скеруйте цю людину до нас.

Чи можу я публікувати результати?

Так. Агреговану статистику, графіки, похідні показники та висновки ви можете публікувати. Передача сирих рядків як даних для відтворення є перерозповсюдженням і потребує письмової угоди, і ми залюбки оформимо її, якщо цього вимагає журнал. Дивіться розмежування вище.

Яка позиція щодо етики та персональних даних?

Лише публічні записи про реєстрацію, DNS і технології. Жодних контактних персональних даних: ні імен реєстрантів, ні електронних адрес, ні телефонів. Так задумано навмисно, і саме тому етична експертиза зазвичай минає швидко.

Чи задокументована методологія?

Одна стабільна задокументована схема для всіх датасетів, з однаковими ключами в кожному рядку. Сигнали рейтингу, PageRank і Harmonic Centrality, ми обчислюємо самі на графі, який індексуємо.

Проведіть перше вимірювання безкоштовно

10 000 справжніх рядків, без облікового запису. Якщо числа вас переконають, повний перепис коштує €29, а всі колонки €599.