Ir para o conteúdo
TextArray
Totalmente local

Remover linhas duplicadas por coluna

Eliminar linhas CSV/TSV cujo valor em uma coluna escolhida já apareceu.

Entrada
Saída

Remover linhas duplicadas por coluna

A desduplicação de linha inteira ignora o problema real: duas linhas raramente são idênticas, elas apenas compartilham o mesmo e-mail, ID ou SKU, enquanto todo o resto é diferente. Esta ferramenta avalia as linhas por uma coluna de sua escolha - a mesma chave que aparece duas vezes remove a linha posterior, mantendo o conjunto de dados uma linha por chave sem uma fórmula de planilha à vista.

Cole CSV, TSV ou qualquer linha delimitada; o delimitador é detectado a partir da primeira linha de dados (vírgula, ponto e vírgula, tabulação ou barra vertical) com uma substituição manual para casos extremos. Escolha a coluna-chave pelo seu número baseado em 1, informe à ferramenta se a primeira linha é um cabeçalho – os cabeçalhos são preservados e nunca comparados – e escolha qual ocorrência sobreviverá. Manter primeiro é o padrão; manter o último é o truque clássico para registros de alterações e exportações, onde a linha mais recente por chave fica na parte inferior. Os valores são cortados antes da comparação e uma opção ignorar maiúsculas e minúsculas mescla [email protected] com [email protected].

A contagem relata as remoções e a contagem de linhas de cada lado, de modo que uma colagem que silenciosamente não fez nada – coluna errada, delimitador errado – é imediatamente visível. As linhas menores que a coluna-chave contam como tendo um valor vazio e são desduplicadas entre si.

Uma limitação honesta: a divisão é simples, não uma análise CSV completa, portanto, um campo entre aspas contendo o próprio delimitador confundirá a contagem de colunas - execute esses arquivos primeiro por meio do alterador de delimitador CSV. Tudo roda localmente no seu navegador; seus dados nunca saem do seu dispositivo.

FAQ

Como isso difere da remoção de linhas duplicadas?
A remoção de linha duplicada precisa que toda a linha corresponda. Aqui apenas a coluna escolhida é comparada – duas linhas com o mesmo ID de cliente, mas com carimbos de data/hora diferentes, contam como duplicatas, que geralmente é o que um conjunto de dados realmente precisa.
Quando devo manter a última ocorrência em vez da primeira?
Quando o arquivo é ordenado por acréscimo e o registro mais recente vence: exportações onde cada atualização adiciona uma linha, logs, fluxos de eventos. Keep last fornece o estado mais recente por chave; keep first preserva a entrada original.
Como funciona a detecção automática do delimitador?
A primeira linha de dados é verificada em busca de vírgulas, ponto e vírgula, tabulações e barras verticais, e a mais frequente vence. A contagem mostra qual foi usado - se acertou errado, force o acerto com a opção de delimitador.
E os campos entre aspas que contêm vírgulas?
A divisão é deliberadamente simples, portanto, um campo entre aspas com um delimitador incorporado desloca as colunas dessa linha. Para esses arquivos, normalize primeiro com a ferramenta de delimitador CSV (por exemplo, para guias) e depois desduplique aqui.
Meus dados são carregados em algum lugar?
Não. A desduplicação é executada inteiramente no seu navegador e seus dados nunca saem do seu dispositivo.