Déposez un extrait de votre base (jusqu'à 1000 lignes) : prénom, nom, adresse, téléphone, e-mail, carte ou compte client — gardez la ligne d'en-têtes, les colonnes sont reconnues automatiquement.
Rien ne quitte votre navigateur. Cet outil ne fait aucun appel réseau : le calcul est exécuté en JavaScript sur la page que vous avez déjà chargée. Vous pouvez couper votre connexion, il continuera de fonctionner. Aucune saisie n'est transmise, ni à nos serveurs ni à un tiers, et rien n'est conservé.
Le problème que ça résout
Une base de particuliers ne contient pas des individus isolés. Elle contient des couples, des familles, des colocations : des personnes distinctes qui partagent une adresse, une carte de fidélité, une ligne téléphonique. La plupart des CRM ne savent pas le voir. Ils connaissent la relation quand elle est déclarée ; ils ne la déduisent jamais.
Deux erreurs symétriques en découlent. La première consiste à fusionner ce qui ne doit pas l'être : un père et son fils qui portent le même prénom et partagent le numéro du domicile ressortent en doublon sur la plupart des règles de déduplication. Les fusionner supprime un client réel, avec son historique et sa valeur. La seconde consiste à ignorer le lien : trois envois partent le même jour au même logement, la pression est comptée par contact, la valeur client aussi, et le foyer qui achète pour quatre est vu comme quatre acheteurs occasionnels.
Cet outil traite le fichier entier : chaque fiche est comparée à celles qui partagent un signal avec elle, les liens retenus sont réunis par transitivité — madame partage l'adresse, monsieur partage la carte — et le résultat est une liste de foyers, pas une suite de paires à recouper à la main.
Comment ça marche
Aucun modèle, aucun apprentissage. Chaque signal partagé entre deux fiches ajoute son poids ; la somme, bornée à 1, donne un score de lien. Le calcul est déterministe : le même fichier donne toujours le même résultat, et chaque point est justifiable.
| Signal partagé | Poids | Pourquoi ce poids |
|---|---|---|
| Carte de fidélité ou compte client | 0,60 | Un identifiant commun est une preuve de rattachement, pas un indice. |
| Même logement (adresse et complément) | 0,40 | Le complément fait la différence entre partager un logement et partager un immeuble. |
| Ligne téléphonique partagée | 0,30 | Un fixe désigne un foyer ; un mobile partagé aussi, dans un couple. |
| Même immeuble (adresse sans complément) | 0,40 à 0,10 | Dépend du nombre de fiches qui la partagent dans votre fichier — voir ci-dessous. |
| Même nom de famille | 0,20 | Fréquent dans un foyer, insuffisant seul. |
| Adresse e-mail partagée | 0,20 | Les adresses génériques (contact@, info@) sont écartées. |
| Prénoms différents | 0,10 | Confirme deux personnes, et non deux fiches d'une seule. |
| Dates de naissance différentes | 0,10 | Le cas du père et du fils homonymes : deux personnes, pas un doublon. |
| Prénoms identiques sans date pour départager | −0,30 | Cela relève du doublon ; le lien de foyer doit être bien mieux étayé. |
Un lien exige au moins un signal matériel — compte, adresse, téléphone, e-mail, ou un homonyme exact du nom de famille. Ce dernier cas ne crée jamais une fusion à lui seul (le score reste plafonné sous le seuil « probable ») — seulement un doute qui mérite d'être vérifié, quand rien d'autre ne permet de trancher.
Le poids d'une adresse sans complément dépend de sa fréquence dans votre fichier, et pas d'une valeur fixe : deux à quatre fiches à la même adresse, c'est un logement (poids 0,40, quasi celui d'un logement complet) ; cinq à huit, c'est déjà une petite copropriété (poids 0,25) ; au-delà, c'est un immeuble, et rapprocher ses habitants fabriquerait un faux foyer (poids 0,10, sous le seuil « à vérifier » à lui seul). C'est le même principe que les probabilités calibrées de Splink : le pouvoir discriminant d'un signal dépend de sa fréquence dans la population qu'on lui présente.
Deux tolérances, calibrées sur des cas réels et jamais utilisées seules : un nom de famille proche (une lettre qui change, « BENALOUANE »/« BENALOUANNE ») vient en appui d'un autre signal, jamais en déclencheur ; un code postal proche (une faute de frappe ou un chiffre manquant) ne dégrade pas un rapprochement dont la rue, elle, est identique au caractère près.
Un garde-fou protège les grands immeubles : deux compléments d'adresse renseignés et différents (« Appt 12 » et « Appt 405 ») annulent le rapprochement par adresse, au même titre qu'un numéro de rue différent — deux logements distincts d'un même immeuble ne sont jamais un foyer.
Trois situations excluent le rattachement d'office : un numéro de sécurité sociale identique, qui désigne une seule personne ; des prénom, nom et date de naissance identiques, qui désignent un doublon ; une valeur de remplissage manifestement factice, comme un numéro à dix zéros, que l'outil refuse de traiter comme un signal.
Deux garde-fous supplémentaires, propres au traitement d'un fichier entier : un signal partagé par un trop grand nombre de fiches (un standard téléphonique, une résidence collective) écarte le groupe entier plutôt que de fabriquer un rapprochement massif ; une chaîne de rapprochements qui dépasserait douze personnes est dissoute plutôt que livrée — ce n'est plus un foyer plausible.
Ce que l'indice ne dit pas
Ce n'est pas une probabilité. Une probabilité se calibre sur des cas dont la réponse est connue : il faudrait des milliers de foyers labellisés, que personne ne possède. Afficher « 87 % de chances » donnerait un chiffre d'apparence scientifique et sans fondement. C'est une somme de signaux, traduite en verdicts, et l'outil affiche toujours ce qui les a produits.
Les poids sont des valeurs de départ, calibrées sur des cas de terrain et non sur une étude statistique. Sur votre fichier, ils s'appliquent tels quels ; sur une base réelle de plusieurs dizaines de milliers de lignes, un second niveau (probabiliste, Splink) les recalibre à partir des fréquences observées — ce que cet outil, borné à 1000 lignes et à la seule couche déterministe, ne fait pas.
Sur un échantillon, un foyer réel peut ne pas apparaître si les deux personnes n'y figurent pas toutes les deux, et une adresse peu fréquente dans votre extrait peut l'être beaucoup plus dans le fichier complet — ce qui changerait le poids retenu. Plus l'extrait est large, plus la fréquence mesurée est fiable.
Cas d'usage
Commerce de détail et fidélité. Rattacher la carte au foyer plutôt qu'au porteur : la valeur client cesse d'être divisée par le nombre de personnes du logement, et le plafonnement de la pression commerciale devient tenable.
Mutuelle et assurance santé. Les ayants droit sont un foyer déclaré ; les fichiers, eux, les perdent souvent en route. Le rapprochement permet de retrouver la cellule assurée quand la donnée de rattachement manque.
Banque et assurance habitation. Un contrat porte sur un logement, une sollicitation part vers une personne : sans lien entre les deux, le même foyer reçoit deux offres concurrentes de la même maison.
Avant toute déduplication. C'est l'usage le plus rentable : vérifier qu'une règle de doublon ne s'apprête pas à fusionner deux personnes réelles.
Aller plus loin
Cet outil applique la seule couche déterministe, sur un échantillon de 1000 lignes maximum, sans conserver ni exporter les résultats. Sur la base entière, deux couches supplémentaires s'ajoutent : un rapprochement probabiliste (Splink) qui recalibre les poids sur les fréquences réelles du fichier, puis un arbitrage par un modèle de langage pour les cas restés ambigus. Le tout est audité, opposable ligne à ligne, et livré avec un CSV réimportable.
C'est ce que fait le CT Audit sur la base entière : foyers identifiés, doublons requalifiés quand ils recouvraient deux personnes distinctes, et volume réellement adressable une fois les foyers regroupés — presque toujours inférieur au nombre de fiches.
Questions fréquentes
Autres outils gratuits
Les cinq outils sont réunis sur la page outils gratuits de fiabilisation de données B2B. Pour traiter une base entière plutôt qu'un échantillon, voyez le CT Audit ou l'API Dataroia.