Toutes les équipes revenus ont vécu cette réunion. RevOps demande un trimestre pour nettoyer le CRM. Le directeur financier demande ce que cela rapporte. Quelqu'un cite une étude de fournisseur selon laquelle les mauvaises données coûtent des millions par an, le directeur financier fait remarquer que l'entreprise n'est pas celle du Fortune 500 de cette étude, et le projet repasse en bas de la liste. Six mois plus tard, la même conversation recommence.
La demande a échoué pour une raison d'architecture, pas de persuasion. Personne n'a pu tracer le coût depuis un champ précis d'une fiche précise jusqu'à une ligne précise du compte de résultat. Les « doublons » étaient un nombre de lignes. Le coût de ces lignes se trouvait dans les agendas des commerciaux, les journaux d'assignation, les rapports de campagne et les prévisions de renouvellement, et aucun système ne les reliait. Tant que vous ne construisez pas cette jointure, la qualité des données reste une opinion.
Ces chiffres établissent que le problème est réel. Ils ne vous disent pas ce qu'il vous coûte. L'estimation très citée de Gartner en 2020, selon laquelle la mauvaise qualité des données coûte aux organisations au moins 12,9 millions de dollars par an en moyenne, décrit de grandes entreprises, tous domaines de données confondus. L'estimation de Thomas Redman publiée en 2017 dans la MIT Sloan Management Review situait le coût des mauvaises données entre 15 % et 25 % du chiffre d'affaires pour la plupart des entreprises, une fourchette si large qu'elle invite le directeur financier à retenir le bas de l'échelle et à le minorer encore. L'enquête 2025 de Validity auprès de 602 utilisateurs de CRM a montré que 76 % d'entre eux estiment que moins de la moitié des données de leur CRM sont exactes et complètes. Cela confirme le schéma, pas votre chiffre.
C'est pourquoi chiffrer la dégradation des données est un problème de systèmes. Les données d'entrée existent déjà dans votre stack : journaux d'activité, horodatages d'assignation, membres de campagne, hiérarchie des comptes, dates de renouvellement. Ce qui manque, c'est un modèle qui relie un défaut au niveau de la fiche à un événement de revenu, et un pipeline qui le recalcule chaque semaine, pour que le chiffre bouge quand les données bougent. Traitez le coût comme une métrique dérivée avec sa traçabilité, pas comme une statistique de slide.
Là où ça casse
Les fiches en double et dégradées ne coûtent pas d'argent du simple fait d'exister. Elles en coûtent quand un processus en aval lit la mauvaise fiche. Quatre modes de défaillance expliquent l'essentiel des dollars, et chacun a un objet précis où le coût peut être mesuré.
Du temps commercial perdu à cause de fiches ambiguës
Un commercial trouve deux contacts du même nom, dont l'un a une adresse e-mail qui a rebondi le mois dernier, et un historique d'activité réparti entre deux comptes. Il reconstitue le contexte avant l'appel, puis l'enregistre sur la première fiche trouvée, ce qui scinde à nouveau l'historique. Le coût apparaît dans les objets Task et Event sous forme de temps sans résultat commercial, et dans les champs de rebond d'e-mail sous forme de séquences envoyées à des personnes parties. L'enquête State of Sales 2024 de Salesforce a montré que les commerciaux consacrent 70 % de leur temps à des tâches autres que la vente ; l'ambiguïté des fiches est l'une des rares parts de ce temps que l'on peut mesurer à partir des journaux du système plutôt que des souvenirs recueillis par une enquête.
Des leads entrants mal assignés
Une demande de démo arrive de la part d'une personne d'un compte cible existant. Le rapprochement lead-compte échoue parce que le champ de domaine est vide sur la fiche sur laquelle travaille le responsable, ou parce que le lead correspond à un doublon qui a un autre responsable. La rotation l'attribue à un commercial qui n'a jamais parlé au compte, et le chronomètre du SLA tourne pendant qu'on règle la question du responsable. Le coût se trouve dans les journaux d'assignation : la règle qui s'est déclenchée, l'historique des changements de responsable et le délai entre la date de création et la première activité.
Une attribution qui scinde un acheteur en trois
L'analyse de Plauti portant sur plus de 12 milliards de fiches Salesforce traitées en 2021, publiée en janvier 2022, a montré que plus de 45 % des nouvelles fiches entrant dans les CRM étaient des doublons. Quand un acheteur existe sous forme de trois contacts, sa participation au webinar se trouve sur l'un, ses téléchargements de contenus sur un autre et le rôle de contact sur l'opportunité sur un troisième. Les rapports d'influence des campagnes lisent les fiches Campaign Member rattachées aux contacts ayant un rôle sur l'opportunité, si bien que les deux tiers du parcours de cet acheteur disparaissent du modèle. Des programmes qui ont fonctionné semblent avoir échoué. D'où viennent ces contacts en trop, et comment empêcher leur création : c'est l'objet de pourquoi votre CRM a trois versions de chaque compte.
Une dérive de segmentation qui masque le risque d'attrition
Les segments clients reposent sur des champs : effectif, secteur, offre, responsable. Quand un compte se scinde en une maison mère et un doublon orphelin, l'usage produit atterrit sur une fiche et l'assignation du CSM sur l'autre. Le score de santé lit la fiche sans usage et signale comme à risque un client en bonne santé, ou lit celle sans responsable et ne signale rien. Les personnes bougent aussi : le Bureau of Labor Statistics américain a recensé 38,0 millions de démissions et 62,8 millions de départs au total en 2025, si bien que les contacts champions se périment en continu, pas une fois par an. Une prévision de renouvellement construite sur des segments périmés est une prévision portant sur les mauvais clients.
Architecture de référence
Un modèle de coûts recalculé à partir de données en direct a besoin de cinq couches. Aucune n'exige de nouvelle plateforme, seulement un contrat clair entre celles que vous avez déjà. Les outils cités sont des exemples, pas des recommandations.
Composants : Objets du CRM (Account, Contact, Lead, Opportunity, Task, Campaign Member), journaux d'assignation, événements de rebond et d'engagement e-mail, usage produit, facturation et dates de renouvellement.
Outils types : Salesforce ou HubSpot, un outil d'assignation, une plateforme de sales engagement, un pipeline d'analyse produit, un système de facturation.
Contrat avec la couche suivante : Les fiches brutes arrivent avec leurs ID natifs et leurs horodatages, sans modification. Le modèle de coûts doit pouvoir rejouer n'importe quelle semaine à partir des données sources.
Composants : Regroupement des doublons sur le domaine et l'e-mail normalisés, indicateurs de péremption (rebond définitif, aucun engagement sur une période définie, changement de poste ou d'entreprise) et contrôles de complétude sur les champs que lit chaque processus en aval.
Outils types : Rapports de doublons natifs, un outil de dédoublonnage ou de rapprochement, ou des modèles SQL ou dbt dans un entrepôt de données. Les règles de rapprochement derrière l'indicateur de doublon sont détaillées dans la résolution d'identité pour RevOps B2B.
Contrat avec la couche suivante : Chaque fiche porte un ensemble d'indicateurs de défaut (ID de groupe de doublons, périmée, incomplète, orpheline) avec la règle qui a produit chaque indicateur.
Composants : Le modèle de coûts : quatre jointures qui relient un indicateur de défaut à un événement de consommation (une activité commerciale, une décision d'assignation, un point de contact d'attribution, un renouvellement), chacune avec une hypothèse de prix écrite.
Outils types : Modèles dans l'entrepôt de données, une couche sémantique de BI ou une tâche planifiée dans un outil de workflows comme n8n.
Contrat avec la couche suivante : Chaque ligne de coût renvoie des dollars, les ID des fiches qui les génèrent et la version des hypothèses utilisée, pour que n'importe quel chiffre puisse être retracé jusqu'aux lignes.
Composants : Une table du coût de la dégradation avec une ligne par poste de coût et par semaine, plus une table d'hypothèses validée par la finance.
Outils types : Une table de l'entrepôt de données, synchronisée vers un objet personnalisé du CRM si la direction travaille dans le CRM.
Contrat avec la couche suivante : Les lignes historiques ne sont jamais écrasées. Quand une hypothèse change, une nouvelle version est écrite et les semaines précédentes sont recalculées côte à côte.
Composants : Une tendance hebdomadaire du coût pour la direction, des files de correction classées en dollars plutôt qu'en nombre de lignes, et des alertes quand un poste de coût bondit.
Outils types : Tableaux de bord de BI, vues de liste du CRM, un agent de supervision qui publie dans Slack ou Teams.
Contrat avec la couche suivante : Chaque élément de la file de correction porte son poids en dollars, pour que l'équipe traite d'abord les fiches les plus coûteuses.
Le modèle lui-même tient en quatre lignes. La première, la deuxième et la quatrième sont des pertes. La troisième est présentée à part comme une exposition, car une dépense mal attribuée est un risque de décision et non de l'argent déjà sorti de l'entreprise, et mélanger les deux est le moyen le plus rapide de perdre la confiance d'un directeur financier.
# Four-line data decay cost model (weekly or annualized)
rep_time_cost = reps x hours_lost_per_rep_week x selling_weeks x loaded_hourly_cost
misrouting_cost = inbound_volume x misroute_rate
x (conv_clean - conv_misrouted) x win_rate x avg_acv
segmentation_cost = arr_on_misclassified_accounts x churn_uplift
decay_loss = rep_time_cost + misrouting_cost + segmentation_cost
attribution_exposure = program_spend x share_of_touches_unlinked # report separately
Un exemple illustratif montre comment les lignes s'additionnent. Tous les chiffres qui suivent sont des nombres ronds inventés pour montrer le calcul, pas une référence de marché ni un résultat client. Prenez une entreprise SaaS B2B à $15M d'ARR avec 20 commerciaux sous quota. Si les journaux d'activité montrent que chaque commercial perd deux heures par semaine à cause de fiches en double et périmées sur 46 semaines de vente, avec un coût horaire chargé de $75, le temps commercial coûte $138 000. Si sur 1 600 demandes entrantes par an, 12 % sont mal assignées, et que les leads mal assignés se convertissent en opportunités à 15 % au lieu de 25 %, avec un taux de signature de 20 % et une valeur moyenne de contrat de $30 000, la mauvaise assignation coûte $115 200. Si $1,2M d'ARR se trouvent sur des comptes scindés ou mal classés à cause des doublons, et que ces comptes résilient cinq points plus souvent, la segmentation coûte $60 000. La perte illustrative due à la dégradation s'établit donc à $313 200, soit environ 2,1 % de l'ARR, avec une exposition d'attribution distincte de $90 000 si 15 % des points de contact d'un budget de programmes de $600 000 ne peuvent pas être rattachés à une opportunité.
Séquence de construction
Construisez le chiffre avant la correction. Quatre semaines de référence vous donnent une liste de corrections hiérarchisée et l'avant-après qui finance le projet suivant.
Définissez les indicateurs de défaut
Écrivez les règles pour doublon, périmé, incomplet et orphelin en langage clair et en SQL. Gardez-les étroites : un doublon, ce sont deux comptes qui partagent un domaine d'entreprise normalisé, pas deux comptes aux noms proches. Le playbook du diagnostic avant la construction explique comment le faire en lecture seule sur les données de production.
Instrumentez les quatre événements de consommation
Pour chaque poste de coût, trouvez l'événement qui prouve qu'un défaut a été lu : une activité enregistrée sur une fiche d'un groupe de doublons, une décision d'assignation sur un lead dont le domaine correspondait à un compte ayant un autre responsable, un point de contact de campagne sur un contact sans rôle sur l'opportunité, un renouvellement sur un compte à l'usage scindé. Si un événement n'est pas journalisé, journalisez-le dès maintenant. Le modèle ne vaut que ce que valent ces jointures.
Arrêtez les hypothèses de prix avec la finance
Le coût horaire chargé, les taux de conversion, le taux de signature, l'ACV et la hausse de l'attrition doivent venir de votre propre historique ou de la finance, pas d'une étude de fournisseur. Placez-les dans une table d'hypothèses versionnée. Un chiffre que la finance a aidé à construire est un chiffre que la finance défend en réunion budgétaire.
Testez sur des cas que votre équipe a déjà tranchés
Rassemblez une vingtaine d'exemples passés par poste de coût, comme des leads mal assignés que l'équipe a analysés ou des renouvellements perdus après la scission d'une fiche, et vérifiez que le modèle les signale et leur attribue un prix plausible. Notre exigence pour tout ce que nous livrons est de 85 % de concordance avec ce qu'aurait conclu un opérateur senior, sinon rien n'est mis en service.
Publiez la table hebdomadaire des coûts
Planifiez le modèle, écrivez une ligne par poste et par semaine et affichez la tendance. Présentez les trois postes de perte en titre et l'exposition d'attribution en dessous, jamais additionnées.
Classez la file de corrections en dollars
Triez les groupes de doublons et les fiches périmées selon le coût qu'ils ont généré sur les 90 derniers jours. Attendez-vous à ce qu'une petite part des fiches génère l'essentiel des dollars, ce qui transforme un nettoyage sans fin en un chantier au périmètre défini.
Construire ou acheter : les compromis
Il existe trois façons réalistes de produire ce chiffre. La plupart des équipes commencent par la première pour gagner le débat, puis passent à la deuxième ou à la troisième quand le chiffre doit rester à jour.
| Approche | Adéquation | Coût de possession | Risque de défaillance |
|---|---|---|---|
| Modèle ponctuel sur tableur à partir d'exports du CRM et de rapports de doublons | Un premier dossier budgétaire, un seul CRM, une direction qui a besoin d'un chiffre ce trimestre | Le plus faible. Quelques jours de travail d'analyste | Périmé la semaine même où il est présenté. Les hypothèses vivent dans des cellules que personne n'audite, et le modèle ne peut pas montrer si la correction a fonctionné |
| Rapports natifs du CRM plus les tableaux de bord d'un outil de qualité des données ou de dédoublonnage | Les doublons sont le défaut principal, et la direction travaille déjà dans le CRM | Modéré. Licence de l'outil plus temps d'administration | Compte bien les défauts, mais les relie rarement aux événements d'assignation, d'attribution ou de renouvellement, et rapporte donc des lignes plutôt que des dollars |
| Modèle de coûts dans l'entrepôt de données avec hypothèses versionnées et agent de supervision | Plusieurs sources, des données produit et de facturation en jeu, un directeur financier qui veut la traçabilité | Le plus élevé. Nécessite un ingénieur data ou GTM responsable des modèles et des tests | Des défaillances silencieuses du pipeline peuvent figer le chiffre. Nécessite des contrôles de fraîcheur et un responsable de la table d'hypothèses |
Le facteur décisif n'est pas l'outillage, mais le fait que le chiffre soit recalculé à partir de données en direct avec des hypothèses validées par la finance. Savoir qui est responsable de ce modèle relève autant de l'organisation que de la technique, et l'arbre de décision GTM engineer ou RevOps manager est un bon moyen de trancher.
En production
Suivez chaque poste de coût chaque semaine, pas seulement le total. Un bond du coût de mauvaise assignation avec un nombre de doublons stable signifie généralement qu'une règle d'assignation a changé, pas que les données se sont dégradées. Surveillez aussi la fraîcheur des entrées : un journal d'assignation qui cesse de se mettre à jour ressemble à un coût qui baisse.
Quand une source est périmée ou qu'une hypothèse manque, le modèle doit renvoyer « non calculé » pour ce poste plutôt que zéro. Un zéro ressemble à un succès et finit en capture d'écran dans une présentation au conseil. Conservez toutes les versions précédentes des hypothèses pour qu'un chiffre recalculé puisse toujours être expliqué.
Commencez par le chiffre de perte et les trois postes qui le composent, puis la ligne d'exposition à part. Dites quelles hypothèses la finance a fournies, montrez la tendance depuis le début de la correction et nommez les fiches qui ont généré la plus grande part. La direction doit voir que le chiffre bouge quand les données s'améliorent, ce qui en fait une métrique plutôt qu'une affirmation.
Sa place dans le système
Un modèle du coût de la dégradation n'est pas un système en soi. C'est la couche de chiffrage qui vous dit quel système construire en premier et prouve qu'il a fonctionné. Le Pipeline Hygiene Sentinel en est l'opérateur naturel : il signale les fiches en double, périmées et orphelines dès qu'elles apparaissent, pour que le poste de coût baisse au lieu que l'historique grossisse entre deux nettoyages. Le poste de mauvaise assignation est celui dont dépend Speed-to-Lead, car assigner en quelques minutes ne sert que si le lead est rattaché au bon compte. Le poste de segmentation alimente le Churn Signal Watchtower, qui ne peut pas surveiller un client dont l'usage et le responsable se trouvent sur des fiches différentes. Et le Board Report Engine est l'endroit où la table hebdomadaire des coûts arrive à la direction, à côté du pipeline et de la rétention plutôt que dans un rapport distinct sur la qualité des données que personne n'ouvre. La carte complète se trouve sur la page des systèmes.
Cet enchaînement est la logique du forward-deployed engineering : chiffrer la fuite sur vos propres données, construire le système qui ferme le poste le plus coûteux et laisser le modèle tourner pour que la prochaine demande de budget commence par un chiffre plutôt que par un débat.
Sources : Gartner, recherches sur la qualité des données (2020), citées sur la page thématique de Gartner consacrée à la qualité des données. Validity, The State of CRM Data Management in 2025 (n=602, juillet 2025). Salesforce, State of Sales (n=5 500, juillet 2024). Thomas C. Redman, « Seizing Opportunity in Data Quality », MIT Sloan Management Review (2017). Plauti, « 80% of all new integration data in CRMs is duplicate » (analyse de plus de 12 milliards de fiches Salesforce en 2021, janvier 2022 ; copie archivée, la page d'origine a été retirée). US Bureau of Labor Statistics, Job Openings and Labor Turnover Survey, chiffres annuels 2025 (mars 2026).




