Перейти к содержанию

Профилировщик CSV

Сканируйте CSV и получите тип каждого столбца, пропущенные значения, подсчёт уникальных и топ значения.

Входные данные
Выходные данные

Профилировщик CSV

Вставьте CSV данные и этот инструмент проанализирует их столбец за столбцом, показав вам, что на самом деле содержится в ваших данных перед тем, как вы создадите конвейер обработки, напишете схему или доверитесь импорту. Для каждого столбца инструмент определяет тип — целое число, десятичное число, дата, логическое значение или текст — и показывает долю значений, которые ему не соответствуют, так что столбец, выглядящий числовым, но скрывающий случайное «N/A» или опечатку, сразу же выделится.

Отчет по каждому столбцу также включает пропущенные ячейки и их долю от общего числа, количество присутствующих уникальных значений и предложение по безопасности использования столбца как ключа: он подходит только когда в каждой строке есть значение и никакие две строки не совпадают. Числовые столбцы получают минимум, максимум и среднее значение; текстовые столбцы получают минимальную и максимальную длину значения. Наиболее частые значения перечисляются с их подсчётом, так что вы можете обнаружить столбец, который на самом деле является категорией, или доминируемый одним повторяющимся значением.

Разделитель определяется автоматически из данных, или вы можете принудительно задать запятую, точку с запятой, табуляцию или вертикальную черту. Отключите «Первая строка — заголовок» для данных, начинающихся сразу же, и переключайтесь между удобным обзором и таблицей, разделённой табуляцией, которую можно вставить в электронную таблицу. Неправильный CSV допускается: строка с недостаточным количеством полей оставляет свои отсутствующие столбцы отмеченными, а дополнительные поля строки с избытком просто игнорируются, а не нарушают весь анализ.

Всё работает локально в вашем браузере — ничто, что вы вставляете, не загружается никуда, что важно для CSV экспортов, которые часто содержат реальные данные клиентов или бизнеса. Скопируйте отчет, загрузите его как .txt файл или отправьте его прямо на вход другого инструмента для продолжения работы.

FAQ

Как определяется тип столбца?
Каждое непустое значение проверяется по шаблонам целого числа, десятичного числа, логического значения и даты; тип, которому соответствует большинство значений, становится предполагаемым типом столбца, и инструмент сообщает долю значений, которые ему не соответствуют.
Что делает столбец «кандидатом ключа»?
Столбец подходит только когда в нём нет пропущенных значений и каждое значение уникально во всех строках — такой же тест, который применил бы база данных для первичного ключа.
Что происходит со строками, у которых неправильное количество столбцов?
Строка с меньшим количеством полей оставляет свои пропущенные столбцы отмеченными как пустые; строка с дополнительными полями просто имеет эти дополнительные значения проигнорированными, так что неправильный CSV не нарушает весь анализ.
Могу ли я профилировать CSV без строки заголовка?
Да. Отключите «Первая строка — заголовок» и каждая строка обрабатывается как данные; столбцы затем помечаются как Столбец 1, Столбец 2 и так далее.
Мои данные CSV загружаются где-нибудь?
Нет. Профилировщик работает полностью в вашем браузере — ваш CSV никогда не покидает ваше устройство, что важно когда он содержит реальные данные клиентов или бизнеса.