Le blog Sourcing.sh
Combien vaut une donnée fraîche ?
Un email vérifié il y a un mois et le même vérifié il y a 18 mois ne valent pas le même prix. Modéliser la dépréciation d'une donnée — et ce que ça change au prix acceptable.

Sur le marché de la donnée B2B, un contact se vend au même prix qu'il ait été vérifié le mois dernier ou il y a dix-huit mois. C'est une anomalie. La valeur d'une donnée n'est pas une propriété de la donnée : c'est une fonction de son âge. Cet article propose un modèle simple pour la calculer — et en tire une conséquence directe sur le prix qu'il est rationnel d'accepter.
La valeur espérée, pas la valeur nominale
Une donnée n'a de valeur que si elle est encore vraie. La bonne unité de compte est donc la valeur espérée : valeur si juste × probabilité qu'elle le soit encore, moins coût si fausse × probabilité inverse. Cette seconde moitié est presque toujours oubliée, alors qu'elle change tout : une donnée fausse ne vaut pas zéro, elle vaut moins que zéro. Un email invalide dégrade la délivrabilité de votre domaine ; un poste obsolète fait perdre vingt minutes à un commercial et un peu de crédibilité à votre marque.
La courbe de dépréciation
La probabilité de validité décroît de façon à peu près exponentielle. Prenons un email professionnel, dont la validité est liée au poste : avec une rotation de l'ordre de 20 % par an sur les fonctions qualifiées — ordre de grandeur communément observé, plus élevé dans la tech —, la dégradation approche 1,5 à 2 % par mois. Concrètement :
- Vérifié il y a 1 mois : environ 97-98 % de chances d'être encore valide.
- Il y a 6 mois : environ 89 %.
- Il y a 12 mois : environ 79 %.
- Il y a 18 mois : environ 70 %, et sensiblement moins sur les populations mobiles.
Chaque champ a sa propre courbe : un numéro SIREN se déprécie très lentement, une offre d'emploi active se périme en quelques semaines, un intitulé de poste se situe entre les deux. Raisonner « par base » n'a pas de sens ; on raisonne par champ.
Le calcul qui change le prix acceptable
Posons des valeurs illustratives : un contact juste vous rapporte en moyenne 5 € (probabilité de réponse × valeur du pipeline généré), un contact faux vous coûte 2 € (temps perdu, délivrabilité, nettoyage). La valeur espérée devient :
- À 1 mois : 0,98 × 5 − 0,02 × 2 ≈ 4,86 €
- À 18 mois : 0,70 × 5 − 0,30 × 2 ≈ 2,90 €
Le même enregistrement a perdu 40 % de sa valeur — et le calcul devient négatif dès que la probabilité de validité passe sous 30 % environ : au-delà d'un certain âge, payer quoi que ce soit détruit de la valeur. Conclusion opérationnelle : accepter le même prix pour une fiche d'âge inconnu et pour une fiche vérifiée le mois dernier, c'est accepter une décote aveugle. L'âge devrait figurer sur l'étiquette, champ par champ.
Un stock vieillit d'un mois par mois
Ce modèle disqualifie une pratique courante : l'achat de base « one-shot ». Une base achetée aujourd'hui à 95 % de validité passe mécaniquement sous 80 % en un an sans que personne ne touche à rien — son âge moyen augmente d'un mois chaque mois. Le seul actif qui ne se déprécie pas est un flux : une base dont chaque fiche est re-vérifiée à un intervalle inférieur à sa demi-vie.
Ce que nous en faisons
C'est la raison d'être de l'architecture de sourcing.sh : un index — environ 200 000 entreprises, 123 000 profils, 1,4 million d'offres — parcouru en continu par des agents dont le travail est précisément de maintenir chaque champ au-dessus de son seuil de valeur, avec une date de fraîcheur exposée plutôt que cachée. Vous ne payez pas des fiches au détail : vous payez, au forfait, le maintien de la courbe au bon niveau — livré là où vous travaillez, CRM, ATS, API ou Claude via MCP.