Le blog Sourcing.sh
200 000 entreprises : comment on compte
Building in public : la méthodologie derrière nos volumes annoncés — ce qui compte comme une fiche, ce qu'on déduplique, ce qu'on exclut, et pourquoi on publie ces règles.

Tous les fournisseurs de données affichent des volumes — « 500 millions de profils », « 50 millions d'entreprises » — et presque aucun ne définit ce qu'il compte. Un chiffre sans méthode de comptage n'est pas une information, c'est un slogan. sourcing.sh annonce environ 200 000 entreprises, 123 000 profils, 98 000 écoles et 1,4 million d'offres d'emploi. Voici, dans une logique de building in public, comment ces chiffres sont produits — y compris ce qu'ils excluent.
Ce qui compte comme une fiche entreprise
Une entreprise entre dans le compte si trois conditions sont réunies :
- Un identifiant fort : SIREN pour la France, ou à défaut un domaine web actif rattachable sans ambiguïté à l'entité.
- Un seuil de complétude : au minimum le nom, un identifiant fort et deux champs de contexte (secteur, effectif, localisation ou activité).
- Un signal de vie : au moins une trace d'activité observée sur les 24 derniers mois — publication d'offre, mise à jour de site, événement légal.
Une marque n'est pas une fiche ; une filiale avec son propre SIREN et sa propre activité en est une. Un groupe avec dix filiales peut donc compter pour onze — nous préférons documenter ce choix plutôt que le lisser.
La déduplication, avant tout le reste
Nos agents agrègent plusieurs sources partenaires ; la même entreprise arrive donc plusieurs fois, sous des noms légèrement différents. Le pipeline fusionne d'abord sur clés fortes (SIREN, domaine), puis sur clés faibles (nom normalisé + localisation) avec arbitrage. Ordre de grandeur : le stock brut dépasse 260 000 fiches ; environ un quart fusionne ou disparaît pour aboutir aux quelque 200 000 publiés. Une volumétrie annoncée avant déduplication est mécaniquement gonflée de 20 à 40 % — c'est la première question à poser à n'importe quel fournisseur.
Ce que les chiffres excluent
- Entreprises : sociétés radiées, holdings sans activité détectable, fiches sous le seuil de complétude.
- Profils (~123 000) : uniquement des profils issus de sources partenaires, avec un signal d'actualité de moins de 24 mois ; un profil sans aucune mise à jour observable sort du compte.
- Écoles (~98 000) : établissements et campus distincts, formation initiale et continue confondues — le chiffre compte des lieux d'enseignement, pas des diplômes.
- Offres d'emploi (~1,4 million) : offres vues actives sur une fenêtre glissante, dédupliquées entre agrégateurs — une même offre publiée sur quatre jobboards compte pour une. Les offres expirées sortent du chiffre, même si nous les conservons en historique.
Pourquoi « environ »
Ces chiffres bougent tous les jours : les agents ajoutent, fusionnent, périment. Publier un compteur à l'unité serait faux dès le lendemain ; publier un arrondi daté est honnête. Nous mettons les ordres de grandeur à jour lorsque la variation dépasse quelques pour cent, pas avant.
Pourquoi publier la méthode
Trois raisons. D'abord la comparabilité : sans définition commune, comparer deux fournisseurs sur le volume n'a aucun sens, et nous préférons être comparés sur nos règles. Ensuite la discipline : une méthode publiée nous interdit de gonfler discrètement le compte en relâchant un seuil. Enfin la cohérence avec notre thèse : si les applications SaaS deviennent des interfaces posées sur des bases de données, alors la base — sa définition, sa déduplication, sa fraîcheur — est le produit, et un produit doit être auditable. C'est ce que nous construisons depuis Station F, en public, méthode comprise. Les prochains chiffres que nous publierons viendront avec leurs règles de comptage — celles-ci, ou de meilleures.