Un recensement de l’internet, avec un budget recherche
L’ensemble de la population de domaines actifs, pas un échantillon. 409M domaines avec DNS, technologie et classement dans un seul fichier que vous pouvez mesurer, citer et relancer. Le recensement de démarrage coûte €29. Un échantillon gratuit de 10 000 lignes ne nécessite aucun compte.
Mesurez le web dans son ensemble, pas un échantillon de celui-ci
Quatre recettes d’agrégation sur le schéma réel. La première tourne sur le recensement complet à €29. Les autres utilisent all-data quand une question demande plus de colonnes.
DomainTLDDomain typeCountry by IPTechnologiesDNS StatusPR valueHarmonic valueDomain creation date
Domaines par TLD, le recensement complet
La mesure de population la plus simple, et elle fonctionne avec le dataset de démarrage à €29. Comptez tous les domaines actifs par TLD.
zstdcat webatla-all-active-domains-2026-08-17.jsonl.zst |
jq -r '.TLD' |
sort | uniq -c | sort -rn > domains-by-tld.txt
Adoption technologique sur l’ensemble de la population
Combien de sites utilisent chaque technologie, comptés sur l’ensemble du fichier. Le champ Technologies existe sous deux formes, distinguez-le donc selon son type JSON.
WITH t AS ( SELECT CASE json_type("Technologies") WHEN 'ARRAY' THEN json_extract_string("Technologies", '$[*]') WHEN 'OBJECT' THEN json_keys("Technologies") ELSE []::VARCHAR[] END AS techs FROM read_json('webatla-all-data-2026-08-17.jsonl.zst', format='newline_delimited', compression='zstd', columns={'Technologies':'JSON'}) ) SELECT tech, count(*) AS sites FROM t, unnest(t.techs) AS u(tech) GROUP BY tech ORDER BY sites DESC LIMIT 25;
Où le web est hébergé
Répartition des domaines par pays d’hébergement, déterminée à partir de l’IP résolue. Un group-by en une ligne sur l’export entier.
SELECT "Country by IP" AS country, count(*) AS domains FROM read_json('webatla-all-data-2026-08-17.jsonl.zst', format='newline_delimited', compression='zstd', columns={'Country by IP':'VARCHAR'}) WHERE country IS NOT NULL GROUP BY country ORDER BY domains DESC;
Quelle part de l’espace de noms résout en DNS
Un chiffre clé reproductible. Le pourcentage de domaines suivis qui répondent actuellement en DNS, directement depuis le fichier.
SELECT "DNS Status" AS resolves, count(*) AS n, round(100.0*count(*)/sum(count(*)) OVER (), 2) AS pct FROM read_json('webatla-all-data-2026-08-17.jsonl.zst', format='newline_delimited', compression='zstd', columns={'DNS Status':'VARCHAR'}) GROUP BY resolves ORDER BY n DESC;
Chaque recette fonctionne sans modification sur l’échantillon et sur le fichier complet. Indiquez le chiffre que vous obtenez, et citez le fichier daté dont il provient.
Oui, vous pouvez publier ce que vous trouvez
La distinction honnête entre travaux académiques et étude de marché.
Publiez librement
- Statistiques agrégées, tableaux, graphiques et cartes
- Résultats, méthodes et conclusions dans un article ou un rapport
- Une poignée de domaines d’exemple pour illustrer un propos
- Indicateurs et indices dérivés que vous calculez vous-même
Le travail est le vôtre. Citez le dataset et la date du snapshot afin que d’autres puissent aligner leurs chiffres sur les vôtres.
Commencer par le recensementPour partager les lignes brutes, il faut nous en parler d’abord
- La publication du dataset brut comme données de réplication ou complémentaires
- La redistribution du fichier en totalité ou en grande partie
C’est de la redistribution, qui nécessite un accord écrit. Si une revue exige des données de réplication ouvertes, dites-le-nous. Nous préférons vous aider à répondre à cette exigence plutôt que de vous laisser dans l’impasse.
Demander les conditions académiquesCe qui le rend adapté à la recherche
Pas une API de plus que vous devez nuancer dans la section méthodes.
Population complète, pas un échantillon
Vous mesurez chaque domaine actif que nous suivons, votre dénominateur est donc le vrai. Aucune base d’échantillonnage à justifier devant un relecteur.
Un snapshot fixe et citable
Chaque export est daté. Citez le fichier et la date, et n’importe qui peut demander le même instantané et reproduire votre tableau.
Citez des chiffres exacts
Le chiffre est le chiffre. 409,870,541 domaines dans cet instantané, pas une estimation cachée derrière une limite de débit qui répond différemment à chaque exécution.
S’intègre dans une ligne de subvention
Le recensement de départ coûte €29 et l’ensemble combiné coûte €599. De quoi couvrir la plupart des budgets de mémoire ou de département, sans procédure d’achat.
Format ouvert, ennuyeux
Un fichier avec un objet JSON par ligne. Aucun lecteur propriétaire à décrire dans la méthodologie, aucun client à installer sur une machine verrouillée.
Uniquement des registres publics
Aucune donnée personnelle de contact : ni noms, ni e-mails, ni numéros de téléphone. Des faits d’enregistrement, de DNS et de technologie, le type de données qu’un comité d’éthique approuve sans difficulté.
Par où commencer
Achetez le plus petit dataset qui répond à votre question. Passez à un plus grand seulement si vous avez besoin de plus de colonnes.
all-active-domains, €29
Le recensement. Chaque domaine actif avec son TLD et son type. Suffisant pour les dénombrements de population, les études par TLD et les lignes de base de couverture.
technologies, €159
Stacks détectées par domaine pour des études d’adoption sur 3,033 technologies.
websites-ranking, €99
PageRank et autorité harmonique pour des études de centralité et de portée.
all-data, €599
Toutes les colonnes jointes sur une seule clé. Quand votre question porte à la fois sur le DNS, le WHOIS, la technologie et le classement.
Les questions qu’un évaluateur poserait
Répondu sans détour.
S’agit-il de la population entière ou d’un échantillon ?
L’ensemble de la population de domaines actifs que nous suivons, 409,870,541 domaines dans l’instantané actuel. Pas un échantillon, vos taux et parts s’appuient donc sur le vrai dénominateur.
Comment le rendre reproductible ?
Chaque export porte la date dans le nom de fichier. Citez le dataset et cette date. Le fichier est figé, le même instantané produit donc les mêmes chiffres sur n’importe quelle machine. Si quelqu’un a besoin de l’instantané exact que vous avez utilisé, renvoyez-le vers nous.
Puis-je publier les résultats ?
Oui. Les statistiques agrégées, les figures, les indicateurs dérivés et les conclusions sont à vous, vous pouvez les publier. Partager les lignes brutes comme données de réplication constitue une redistribution et nécessite un accord écrit, et si une revue l’exige, nous nous ferons un plaisir de l’organiser. Voir la répartition ci-dessus.
Quelle est la position sur l’éthique et les données personnelles ?
Uniquement des données publiques d’enregistrement, de DNS et de technologies. Aucune donnée personnelle de contact : aucun nom de titulaire, aucune adresse e-mail, aucun numéro de téléphone. C’est une conception délibérée, ce qui rend généralement l’examen éthique rapide.
La méthodologie est-elle documentée ?
Un schéma unique, stable et documenté pour tous les datasets, avec les mêmes clés sur chaque ligne. Les signaux de classement, PageRank et centralité harmonique, sont calculés par nos soins sur le graphe que nous indexons.
Faites votre première mesure gratuitement
10 000 lignes réelles, sans compte. Si les chiffres tiennent la route, le recensement complet coûte €29 et toutes les colonnes coûtent €599.