BlogDados mestres

Matching de dados: o que é, como funciona e por que decide se dois cadastros são a mesma entidade

Matching de dados: o que é, como funciona no MDM, as ferramentas do mercado e por que decide se dois cadastros são a mesma entidade.

Paulo Cordeiro10 min de leitura

Matching de dados é o processo pelo qual um sistema de MDM compara registros vindos de fontes diferentes e decide se dois cadastros, mesmo escritos de formas distintas, representam a mesma entidade real: o mesmo material, o mesmo fornecedor, o mesmo cliente.

Parece simples até você olhar para dentro de uma base de materiais de verdade. "Parafuso allen M6 x 20mm zincado" e "PARAF ALLEN M6X20 ZINC" podem ser o mesmo item, cadastrados por duas pessoas diferentes, em dois momentos diferentes, sem que nenhum sistema avise que aquilo já existe. O matching é a camada que resolve exatamente esse tipo de problema, antes que ele vire estoque duplicado, compra repetida ou um relatório de gastos que mente para o diretor de compras.

Eu já vi empresa comprando o mesmo item de duas formas diferentes, cada uma com seu próprio código, seu próprio contrato e seu próprio histórico de preço. Ninguém mentiu, ninguém errou de propósito. Só faltou um mecanismo capaz de olhar para dois registros parecidos e dizer: isso aqui é a mesma coisa.

Como o matching funciona na prática

Todo motor de matching parte de uma pergunta simples: que atributos eu uso para comparar um registro com outro. No cadastro de materiais, pode ser descrição, unidade de medida, fabricante, código de barras ou NCM. No cadastro de fornecedores, pode ser razão social, CNPJ, endereço e nome fantasia. Essa combinação de campos usada na comparação chama se match key.

A partir daí existem dois caminhos. O matching determinístico compara campos exatos, com regras fixas: mesmo CNPJ, mesmo código de fabricante, bate. É rápido e previsível, mas quebra na primeira diferença de digitação. O matching probabilístico, também chamado de fuzzy matching, calcula um score de similaridade entre os registros, considerando pequenas variações de grafia, abreviações, ordem das palavras e até erros de digitação. Se o score passa de um determinado limite, o sistema marca os dois registros como possível duplicata e manda para alguém confirmar.

Essa segunda abordagem é a que resolve o problema real de cadastro de materiais, porque ali não existe uma chave única como o CNPJ. Dois analistas descrevem o mesmo parafuso de duas formas diferentes e nenhuma das duas está errada, só são diferentes. O motor de matching compara fonética, abreviação e estrutura do texto para perceber que as duas descrições apontam para o mesmo objeto físico.

Um ponto que costuma gerar confusão: matching não é a mesma coisa que validação cadastral. Validar um fornecedor é conferir se o CNPJ está ativo na Receita, se a certidão não venceu, se a situação cadastral está regular. Matching é outra etapa: depois que o cadastro existe, decidir se ele já tinha sido feito antes, com outro nome, por outra pessoa.

Quem cuida do matching dentro da empresa

O motor de matching roda dentro da ferramenta de MDM, mas a decisão final sobre o que fazer com um match suspeito não pode ficar só com a máquina. Toda implementação madura tem um fluxo de revisão, normalmente conduzido pelo data steward do domínio, que recebe a lista de prováveis duplicatas e confirma, rejeita ou ajusta.

Isso significa que matching de dados não é projeto de TI sozinho. Compras precisa validar matches de material porque conhece a especificação técnica. O time fiscal participa quando o match envolve NCM ou classificação tributária. Supply chain entra quando o item tem variação de embalagem ou unidade que parece diferença, mas não é. A tecnologia entrega o motor e o score. A decisão sobre o que o score significa no seu negócio é de quem convive com o cadastro todo dia.

Defini isso no meu livro Master Data Management: Fundamentos e Aplicações: ferramenta de MDM sem dono do dado definido vira um motor de match rodando sozinho, empilhando sugestões que ninguém revisa.

Quais ferramentas fazem matching de dados mestres

O mercado de MDM tem soluções específicas para esse processo, cada uma com sua forma de calcular similaridade e de apresentar o resultado para revisão humana. O SAP Master Data Governance, voltado para quem já opera no ambiente SAP, incorpora regras de matching dentro do próprio fluxo de aprovação de cadastro. A Informatica MDM tem um dos motores de match and merge mais usados em grandes implementações, com algoritmos configuráveis por domínio.

A Stibo Systems e a Reltio também têm motores de matching maduros, com foco forte em produto e em cliente, respectivamente. A Semarchy e a Profisee trazem abordagens mais ágeis de configuração, o que ajuda empresas que querem implementar mais rápido sem perder qualidade na comparação. A Ataccama, historicamente mais ligada a qualidade de dados, também oferece matching como parte do pacote de limpeza e padronização da base.

Nenhuma dessas ferramentas substitui a decisão de negócio. Elas aceleram a comparação e aprendem com o histórico de confirmações, mas o critério do que é ou não a mesma entidade continua sendo definido pela empresa, na regra de match configurada.

O que acontece depois do match: survivorship e golden record

Quando dois ou mais registros são confirmados como a mesma entidade, o sistema precisa decidir qual versão de cada campo vai sobreviver no cadastro final, o chamado golden record. Essa decisão segue regras de sobrevivência, conhecidas como survivorship rules.

Uma regra comum é priorizar o dado mais recente. Outra é priorizar a fonte mais confiável, por exemplo, considerar o CRM como fonte da verdade para telefone de contato e o ERP como fonte da verdade para dado fiscal. Também é comum usar o campo mais completo: entre dois endereços, vence o que tem CEP preenchido.

Survivorship mal definido cria um golden record pior do que os registros originais, porque mistura o pedaço errado de cada fonte. Já vi caso de cadastro de fornecedor que, depois da fusão automática, ficou com o telefone de uma filial e o endereço de outra. Tecnicamente era um registro só. Na prática era um registro errado, só que com um nome bonito: golden record.

Como aprender matching de dados na prática

Quem quer entender matching de verdade precisa primeiro dominar os fundamentos de qualidade de dados e de modelagem de dados mestres, porque a lógica de comparação só faz sentido quando você entende a estrutura do domínio que está comparando. Depois disso, vale estudar a fundo as dimensões de qualidade de dados, a diferença entre dados de referência e dados mestres, e como cada ferramenta do mercado trata o score de similaridade.

A certificação CDMP da DAMA ajuda a organizar esse conhecimento dentro de um corpo de conhecimento reconhecido internacionalmente, o DAMA DMBOK. Não é sobre colecionar certificado. É sobre ter o vocabulário certo para discutir regra de match com um fornecedor de software sem depender só do que o vendedor apresenta no slide.

Na prática, a forma mais rápida de aprender é pegar uma base real, com duplicidade conhecida, e tentar configurar uma regra de match simples: comparar descrição e unidade de medida, por exemplo, e ver quantos falsos positivos e falsos negativos aquela regra gera. Depois ajustar. Matching se aprende ajustando, não lendo manual.

As oportunidades de carreira em matching e MDM

Profissionais que entendem matching de dados são procurados em projetos de implementação de MDM, em migrações para SAP S/4HANA e em qualquer iniciativa de unificação de cadastro depois de fusão ou aquisição. É uma habilidade que mistura conhecimento técnico de ferramenta com conhecimento de negócio do domínio, e essa combinação é rara.

Data steward, analista de dados mestres e especialista em qualidade de dados são os papéis que mais usam matching no dia a dia. Conforme o profissional evolui, essa experiência vira porta de entrada para posições de arquiteto de MDM e, mais à frente, para liderança de governança de dados. A demanda por gente que entende matching tende a crescer junto com a adoção de IA nas empresas, porque modelo de IA treinado em cima de cadastro duplicado aprende o erro junto com o padrão certo.

Principais dúvidas sobre matching de dados

Matching de dados é a mesma coisa que deduplicação? Não exatamente. Deduplicação é o resultado, eliminar ou unificar registros duplicados. Matching é a técnica usada para identificar quais registros são candidatos a essa unificação antes de qualquer ação ser tomada.

Qual a diferença entre matching determinístico e probabilístico? O determinístico compara campos exatos e só considera match quando bate tudo. O probabilístico calcula um score de similaridade e aceita variações de grafia, abreviação e ordem das palavras, sinalizando como possível match tudo que passa de um limite definido.

Matching de dados substitui a revisão humana? Não. O motor de matching indica candidatos e calcula probabilidade de ser a mesma entidade. A confirmação final, principalmente em casos de score intermediário, deve passar por um data steward que conhece o domínio.

Toda ferramenta de MDM tem motor de matching próprio? A maioria das plataformas relevantes do mercado, como SAP MDG, Informatica, Stibo, Reltio, Semarchy, Profisee e Ataccama, oferece algum motor de matching nativo. A qualidade e a flexibilidade de configuração variam bastante entre elas.

Matching funciona bem para fornecedores no Brasil? Para fornecedor, o CNPJ já funciona como chave única na maioria dos casos, o que reduz a necessidade de matching fuzzy. O ganho maior de matching no Brasil está em material, onde não existe uma chave única natural e a mesma peça pode ser descrita de dezenas de formas diferentes.

MDM Academy

Tudo que descrevi aqui, da lógica do match key até a configuração de survivorship, é o tipo de conhecimento que ensinamos na MDM Academy, a escola de governança de dados e dados mestres da 4MDG. A Academy nasceu para formar o profissional que o mercado brasileiro procura e não encontra pronto: alguém que entende tecnologia, mas também entende o impacto de um cadastro errado na compra, na venda e no fechamento financeiro.

Os cursos combinam teoria de governança com casos reais de projeto SAP, compras e supply chain, no ritmo de quem já viveu o problema na pele, não de quem só leu a respeito. Quem quer ir além dos cursos pode entrar no Clube dos Dados, nossa comunidade de profissionais de cadastro e governança, onde o assunto do dia pode ser exatamente esse: por que o mesmo parafuso está cadastrado três vezes no seu ERP.

Vale conhecer a MDM Academy se você quer sair do lugar comum de quem só reclama do cadastro ruim e passar a ser a pessoa que resolve.

Conclusão

Matching de dados é uma dessas peças de bastidor que ninguém celebra quando funciona e todo mundo sente quando falha. Ele não aparece em slide de diretoria, não vira manchete, mas decide se a sua empresa compra pelo preço certo, se o inventário bate com a realidade e se a IA que você está implementando vai aprender o padrão certo ou o erro repetido.

Toda vez que alguém me pergunta por onde começar um projeto de MDM, eu respondo a mesma coisa: antes de comprar a ferramenta mais cara do mercado, entenda o tamanho da sua duplicidade. Matching é a técnica. A decisão de levar isso a sério é sua.

Na sua empresa, você já parou para medir quantas vezes o mesmo material está cadastrado com nomes diferentes?

Quer se tornar um especialista em governança de dados? Fale agora com nossos especialistas e conheça a MDM Academy

Quero ser um aluno

Ao submeter seu e-mail, você concorda com a política de privacidade da MDM Academy | 4MDG.

Fale com um especialista