Un recensement de l’internet, avec un budget recherche

L’ensemble de la population de domaines actifs, pas un échantillon. 409M domaines avec DNS, technologie et classement dans un seul fichier que vous pouvez mesurer, citer et relancer. Le recensement de démarrage coûte €29. Un échantillon gratuit de 10 000 lignes ne nécessite aucun compte.

Obtenez un échantillon gratuit de 10 000 lignes Voir le recensement à €29

Puis-je publier des résultats issus de ces données ? →

409Mtoute la population, pas un échantillon
€29recensement de départ, un seul paiement
Datéun snapshot figé que vous pouvez citer
10Klignes d’échantillon gratuites, sans compte

Mesurez le web dans son ensemble, pas un échantillon de celui-ci

Quatre recettes d’agrégation sur le schéma réel. La première tourne sur le recensement complet à €29. Les autres utilisent all-data quand une question demande plus de colonnes.

DomainTLDDomain typeCountry by IPTechnologiesDNS StatusPR valueHarmonic valueDomain creation date

Domaines par TLD, le recensement complet

La mesure de population la plus simple, et elle fonctionne avec le dataset de démarrage à €29. Comptez tous les domaines actifs par TLD.

bash + jq
zstdcat webatla-all-active-domains-2026-08-17.jsonl.zst |
jq -r '.TLD' |
sort | uniq -c | sort -rn > domains-by-tld.txt

Adoption technologique sur l’ensemble de la population

Combien de sites utilisent chaque technologie, comptés sur l’ensemble du fichier. Le champ Technologies existe sous deux formes, distinguez-le donc selon son type JSON.

duckdb
WITH t AS (
  SELECT CASE json_type("Technologies")
           WHEN 'ARRAY'  THEN json_extract_string("Technologies", '$[*]')
           WHEN 'OBJECT' THEN json_keys("Technologies")
           ELSE []::VARCHAR[] END AS techs
  FROM read_json('webatla-all-data-2026-08-17.jsonl.zst',
       format='newline_delimited', compression='zstd',
       columns={'Technologies':'JSON'})
)
SELECT tech, count(*) AS sites
FROM t, unnest(t.techs) AS u(tech)
GROUP BY tech ORDER BY sites DESC LIMIT 25;

Où le web est hébergé

Répartition des domaines par pays d’hébergement, déterminée à partir de l’IP résolue. Un group-by en une ligne sur l’export entier.

duckdb
SELECT "Country by IP" AS country, count(*) AS domains
FROM read_json('webatla-all-data-2026-08-17.jsonl.zst',
       format='newline_delimited', compression='zstd',
       columns={'Country by IP':'VARCHAR'})
WHERE country IS NOT NULL
GROUP BY country ORDER BY domains DESC;

Quelle part de l’espace de noms résout en DNS

Un chiffre clé reproductible. Le pourcentage de domaines suivis qui répondent actuellement en DNS, directement depuis le fichier.

duckdb
SELECT "DNS Status" AS resolves, count(*) AS n,
       round(100.0*count(*)/sum(count(*)) OVER (), 2) AS pct
FROM read_json('webatla-all-data-2026-08-17.jsonl.zst',
       format='newline_delimited', compression='zstd',
       columns={'DNS Status':'VARCHAR'})
GROUP BY resolves ORDER BY n DESC;

Chaque recette fonctionne sans modification sur l’échantillon et sur le fichier complet. Indiquez le chiffre que vous obtenez, et citez le fichier daté dont il provient.

Oui, vous pouvez publier ce que vous trouvez

La distinction honnête entre travaux académiques et étude de marché.

Publiez librement

  • Statistiques agrégées, tableaux, graphiques et cartes
  • Résultats, méthodes et conclusions dans un article ou un rapport
  • Une poignée de domaines d’exemple pour illustrer un propos
  • Indicateurs et indices dérivés que vous calculez vous-même

Le travail est le vôtre. Citez le dataset et la date du snapshot afin que d’autres puissent aligner leurs chiffres sur les vôtres.

Commencer par le recensement

Pour partager les lignes brutes, il faut nous en parler d’abord

  • La publication du dataset brut comme données de réplication ou complémentaires
  • La redistribution du fichier en totalité ou en grande partie

C’est de la redistribution, qui nécessite un accord écrit. Si une revue exige des données de réplication ouvertes, dites-le-nous. Nous préférons vous aider à répondre à cette exigence plutôt que de vous laisser dans l’impasse.

Demander les conditions académiques

Ce qui le rend adapté à la recherche

Pas une API de plus que vous devez nuancer dans la section méthodes.

Population complète, pas un échantillon

Vous mesurez chaque domaine actif que nous suivons, votre dénominateur est donc le vrai. Aucune base d’échantillonnage à justifier devant un relecteur.

Un snapshot fixe et citable

Chaque export est daté. Citez le fichier et la date, et n’importe qui peut demander le même instantané et reproduire votre tableau.

Citez des chiffres exacts

Le chiffre est le chiffre. 409,870,541 domaines dans cet instantané, pas une estimation cachée derrière une limite de débit qui répond différemment à chaque exécution.

S’intègre dans une ligne de subvention

Le recensement de départ coûte €29 et l’ensemble combiné coûte €599. De quoi couvrir la plupart des budgets de mémoire ou de département, sans procédure d’achat.

Format ouvert, ennuyeux

Un fichier avec un objet JSON par ligne. Aucun lecteur propriétaire à décrire dans la méthodologie, aucun client à installer sur une machine verrouillée.

Uniquement des registres publics

Aucune donnée personnelle de contact : ni noms, ni e-mails, ni numéros de téléphone. Des faits d’enregistrement, de DNS et de technologie, le type de données qu’un comité d’éthique approuve sans difficulté.

Les questions qu’un évaluateur poserait

Répondu sans détour.

S’agit-il de la population entière ou d’un échantillon ?

L’ensemble de la population de domaines actifs que nous suivons, 409,870,541 domaines dans l’instantané actuel. Pas un échantillon, vos taux et parts s’appuient donc sur le vrai dénominateur.

Comment le rendre reproductible ?

Chaque export porte la date dans le nom de fichier. Citez le dataset et cette date. Le fichier est figé, le même instantané produit donc les mêmes chiffres sur n’importe quelle machine. Si quelqu’un a besoin de l’instantané exact que vous avez utilisé, renvoyez-le vers nous.

Puis-je publier les résultats ?

Oui. Les statistiques agrégées, les figures, les indicateurs dérivés et les conclusions sont à vous, vous pouvez les publier. Partager les lignes brutes comme données de réplication constitue une redistribution et nécessite un accord écrit, et si une revue l’exige, nous nous ferons un plaisir de l’organiser. Voir la répartition ci-dessus.

Quelle est la position sur l’éthique et les données personnelles ?

Uniquement des données publiques d’enregistrement, de DNS et de technologies. Aucune donnée personnelle de contact : aucun nom de titulaire, aucune adresse e-mail, aucun numéro de téléphone. C’est une conception délibérée, ce qui rend généralement l’examen éthique rapide.

La méthodologie est-elle documentée ?

Un schéma unique, stable et documenté pour tous les datasets, avec les mêmes clés sur chaque ligne. Les signaux de classement, PageRank et centralité harmonique, sont calculés par nos soins sur le graphe que nous indexons.

Faites votre première mesure gratuitement

10 000 lignes réelles, sans compte. Si les chiffres tiennent la route, le recensement complet coûte €29 et toutes les colonnes coûtent €599.