Удалить повторяющиеся строки по столбцу
Удалите строки CSV/TSV, значение которых уже появилось в одном выбранном столбце.
Удалить повторяющиеся строки по столбцу
Дедупликация всей строки упускает из виду реальную проблему: две строки редко бывают идентичными, они просто имеют один и тот же адрес электронной почты, идентификатор или SKU, а все остальное различается. Этот инструмент оценивает строки по одному столбцу по вашему выбору — один и тот же ключ, появляющийся дважды, удаляет более позднюю строку, сохраняя набор данных по одной строке на ключ без формулы электронной таблицы.
Вставьте CSV, TSV или любые строки с разделителями; разделитель определяется по первой строке данных (запятая, точка с запятой, табуляция или вертикальная черта) с ручным переопределением для крайних случаев. Выберите ключевой столбец по его номеру, отсчитываемому от 1, сообщите инструменту, является ли первая строка заголовком (заголовки сохраняются и никогда не сравниваются), и выберите, какое вхождение сохранится. «Сохранить первым» — значение по умолчанию; «Сохранить последним» — это классический прием для журналов изменений и экспорта, когда самая новая строка для каждого ключа находится внизу. Перед сравнением значения обрезаются, а переключатель игнорирования регистра объединяет [email protected] с [email protected].
Подсчет сообщает об удалениях и количестве строк с обеих сторон, поэтому вставка, которая молча ничего не делает — неправильный столбец, неправильный разделитель — сразу видна. Строки короче ключевого столбца считаются имеющими пустое значение и дедуплицируются между собой.
Одно честное ограничение: разделение является простым, а не полным анализом CSV, поэтому поле в кавычках, содержащее сам разделитель, сбивает с толку количество столбцов — сначала пропустите такие файлы через устройство смены разделителей CSV. Все работает локально в вашем браузере; ваши данные никогда не покидают ваше устройство.