Перейти к содержанию
TextArray
100% локально

Удалить повторяющиеся строки по столбцу

Удалите строки CSV/TSV, значение которых уже появилось в одном выбранном столбце.

Входные данные
Выходные данные

Удалить повторяющиеся строки по столбцу

Дедупликация всей строки упускает из виду реальную проблему: две строки редко бывают идентичными, они просто имеют один и тот же адрес электронной почты, идентификатор или SKU, а все остальное различается. Этот инструмент оценивает строки по одному столбцу по вашему выбору — один и тот же ключ, появляющийся дважды, удаляет более позднюю строку, сохраняя набор данных по одной строке на ключ без формулы электронной таблицы.

Вставьте CSV, TSV или любые строки с разделителями; разделитель определяется по первой строке данных (запятая, точка с запятой, табуляция или вертикальная черта) с ручным переопределением для крайних случаев. Выберите ключевой столбец по его номеру, отсчитываемому от 1, сообщите инструменту, является ли первая строка заголовком (заголовки сохраняются и никогда не сравниваются), и выберите, какое вхождение сохранится. «Сохранить первым» — значение по умолчанию; «Сохранить последним» — это классический прием для журналов изменений и экспорта, когда самая новая строка для каждого ключа находится внизу. Перед сравнением значения обрезаются, а переключатель игнорирования регистра объединяет [email protected] с [email protected].

Подсчет сообщает об удалениях и количестве строк с обеих сторон, поэтому вставка, которая молча ничего не делает — неправильный столбец, неправильный разделитель — сразу видна. Строки короче ключевого столбца считаются имеющими пустое значение и дедуплицируются между собой.

Одно честное ограничение: разделение является простым, а не полным анализом CSV, поэтому поле в кавычках, содержащее сам разделитель, сбивает с толку количество столбцов — сначала пропустите такие файлы через устройство смены разделителей CSV. Все работает локально в вашем браузере; ваши данные никогда не покидают ваше устройство.

FAQ

Чем это отличается от удаления повторяющихся строк?
Для удаления повторяющихся строк необходимо, чтобы вся строка совпадала. Здесь сравнивается только выбранный столбец — две строки с одинаковым идентификатором клиента, но с разными временными метками считаются дубликатами, что обычно и нужно набору данных.
Когда мне следует сохранять последнее вхождение вместо первого?
Когда файл упорядочен по добавлению и побеждает самая новая запись: экспорт, при котором каждое обновление добавляет строку, журналы, потоки событий. Keep Last дает вам последнее состояние для каждого ключа; Keep first сохраняет исходную запись.
Как работает автоматическое определение разделителя?
Первая строка данных сканируется на наличие запятых, точек с запятой, табуляции и вертикальной черты, и побеждает наиболее часто встречающаяся. Подсчет показывает, какой из них был использован — если он ошибся, выберите правильный с помощью опции разделителя.
А как насчет полей в кавычках, содержащих запятые?
Разделение намеренно простое, поэтому поле в кавычках со встроенным разделителем смещает столбцы этой строки. Для таких файлов сначала выполните нормализацию с помощью инструмента-разделителя CSV (например, до вкладок), а затем выполните дедупликацию здесь.
Загружены ли мои данные куда-нибудь?
Нет. Дедупликация полностью выполняется в вашем браузере, и ваши данные никогда не покидают ваше устройство.