Перейти до вмісту
TextArray
100% локально

Видаліть повторювані рядки за стовпцями

Видалити рядки CSV/TSV, значення яких уже з’явилися в одному вибраному стовпці.

Введення

Видаліть повторювані рядки за стовпцями

Дедуплікація цілого рядка упускає справжню проблему: два рядки рідко бувають ідентичними, вони просто мають однакову електронну адресу, ID або SKU, а все інше відрізняється. Цей інструмент оцінює рядки за одним стовпцем на ваш вибір — той самий ключ, який з’являється двічі, видаляє пізніший рядок, зберігаючи набір даних по одному рядку на ключ без формули електронної таблиці.

Вставте CSV, TSV або будь-які розділені рядки; роздільник визначається з першого рядка даних (кома, крапка з комою, табуляція або вертикальна лінія) з ручним перевизначенням для крайніх випадків. Виберіть ключовий стовпець за його числом від 1, повідомте інструменту, чи є перший рядок заголовком — заголовки зберігаються й ніколи не порівнюються — і виберіть, який випадок залишиться. Зберігати першим є типовим; Зберігати останнім — це класичний трюк для журналів змін і експорту, де найновіший рядок для ключа знаходиться внизу. Значення обрізаються перед порівнянням, а перемикач ігнорування регістру об’єднує [email protected] із [email protected].

Підрахунок повідомляє про видалення та кількість рядків з обох боків, тож вставлення, яке мовчки нічого не робило — неправильний стовпець, неправильний роздільник — одразу видно. Рядки, коротші за ключовий стовпець, вважаються такими, що мають порожнє значення та дедуплікуються між собою.

Одне чесне обмеження: розділення є звичайним, а не повним синтаксичним аналізом CSV, тому поле в лапках, яке містить сам роздільник, плутатиме підрахунок стовпців — спершу пропустіть такі файли через засіб зміни роздільників CSV. Усе працює локально у вашому браузері; ваші дані ніколи не залишають ваш пристрій.

FAQ

Чим це відрізняється від видалення дублікатів рядків?
Для видалення повторюваних рядків потрібен відповідний увесь рядок. Тут порівнюється лише вибраний стовпець — два рядки з однаковим ідентифікатором клієнта, але різними часовими мітками вважаються дублікатами, що зазвичай насправді потрібно для набору даних.
Коли я маю зберегти останній випадок замість першого?
Коли файл упорядковано за додаванням і виграє найновіший запис: експорт, де кожне оновлення додає рядок, журнали, потоки подій. Keep last (Зберігати останній) дає вам останній стан для кожного ключа; keep first зберігає початковий запис.
Як працює автоматичне визначення роздільників?
Перший рядок даних перевіряється на наявність ком, крапок з комою, знаків табуляції та вертикальних ліній, і виграє той, який найчастіше зустрічається. Підрахунок показує, який був використаний — якщо він вгадав неправильно, форсуйте правильний за допомогою опції розділювача.
А як щодо полів у лапках, які містять коми?
Поділ навмисне простий, тому поле в лапках із вбудованим роздільником зсуває стовпці цього рядка. Для таких файлів спочатку нормалізуйте за допомогою інструмента роздільника CSV (наприклад, до вкладок), а потім дедуплікуйте тут.
Мої дані кудись завантажуються?
Ні. Дедуплікація повністю виконується у вашому браузері, і ваші дані ніколи не залишають ваш пристрій.