Перейти к содержанию
100% локально

Нечёткое сопоставление списков

Сопоставляйте элементы двух списков, даже если они отличаются опечатками, пробелами или ударениями.

Входные данные
Список B
70
Выходные данные

Нечёткое сопоставление списков

Вставьте два списка, и этот инструмент сопоставит похожие элементы, даже если они записаны не одинаково. Он справляется с беспорядком, который не может обработать точное совпадение: список клиентов, где «Jonathan Smith» должен совпасть с «Jon Smith», выгрузка, где «café Latte» должна совпадать с «cafe latte», или две колонки, где в одной записи есть лишняя запятая. Каждой паре присваивается оценка сходства, чтобы вы видели точно, насколько близко совпадение.

Две опции определяют, насколько снисходительным будет сравнение. Порог сходства устанавливает минимальный балл от 0 до 100, необходимый для паре, чтобы считаться совпадением. Метрика определяет, как рассчитывается этот балл: расстояние Левенштейна подсчитывает количество правок, необходимых для превращения одного элемента в другой, что подходит для коротких строк типа имён и кодов, а сходство символьных триграмм сравнивает перекрывающиеся трёхбуквенные фрагменты и лучше справляется с переупорядоченным или частично переписанным текстом. Игнорирование диакритических знаков, игнорирование регистра и игнорирование пунктуации удаляют форматирующий шум, который не должен влиять на совпадение, а нормализация порядка слов позволяет «Smith, Jonathan» совпадать с «Jonathan Smith», сравнивая слова как набор, а не в последовательности.

По умолчанию каждый элемент совпадает не более одного раза с его единственным лучшим соответствием — отключите эту опцию, чтобы элемент мог совпадать со всем выше порога, что полезно при проверке близких дубликатов, а не при связывании чистых списков. Неспаренные элементы отдельно выводятся, когда эта опция включена, поэтому ничего не исчезает молча. Выберите пары для быстрого просмотра или CSV со счётом для электронной таблицы.

Всё выполняется локально в вашем браузере: ни один список нигде не загружается, что важно, когда данные — это список клиентов или контактов. Скопируйте результат, загрузите его как файл .txt или отправьте прямо в другой инструмент для продолжения работы.

FAQ

Что считается совпадением?
Любая пара элементов — по одному из каждого списка — чей балл сходства равен или превышает установленный вами порог. Снизьте порог, чтобы ловить более слабые совпадения, или повысьте его, чтобы принимать только почти одинаковые элементы.
В чём разница между двумя метриками?
Расстояние Левенштейна подсчитывает односимвольные правки и хорошо работает с короткими строками типа имён или кодов. Сходство символьных триграмм сравнивает перекрывающиеся трёхсимвольные фрагменты и более снисходительно относится к переупорядоченному или сильно переписанному тексту.
Может ли один элемент совпадать более одного раза?
Только если вы отключите «Сопоставить каждый элемент не более одного раза». Когда эта опция включена, каждый элемент спаривается со своим единственным лучшим совпадением с другой стороны; когда она отключена, элемент может появиться в каждой паре, которая превышает порог.
Какой размер списка я могу сравнивать?
Инструмент предупредит и остановится, вместо того чтобы зависнуть, если два списка вместе потребуют неразумное количество сравнений. Для типичных списков имён, адресов электронной почты или коротких записей тысячи элементов с каждой стороны в порядке.
Мои данные загружаются куда-либо?
Нет. Оба списка сравниваются полностью в вашем браузере и никогда не покидают ваше устройство.