Перейти к основному содержанию
ClickHouse поддерживает импорт данных из CSV и экспорт данных в CSV. Поскольку CSV-файлы могут различаться по особенностям формата, включая строки заголовков, пользовательские разделители и символы экранирования, ClickHouse предоставляет форматы и настройки для эффективной обработки каждого такого случая.

Импорт данных из CSV-файла

Перед импортом данных создадим таблицу с подходящей структурой:
Чтобы импортировать данные из CSV-файла в таблицу sometable, можно направить файл напрямую в clickhouse-client:
Обратите внимание, что мы используем FORMAT CSV, чтобы ClickHouse понимал, что данные поступают в формате CSV. Либо можно загрузить данные из локального файла с помощью конструкции FROM INFILE:
Здесь мы используем выражение FORMAT CSV, чтобы ClickHouse понимал формат файла. Мы также можем загружать данные напрямую из URL-адресов с помощью функции url() или из файлов S3 с помощью функции s3().
Мы можем не указывать формат явно для file() и INFILE/OUTFILE. В этом случае ClickHouse автоматически определит формат по расширению файла.

CSV-файлы с заголовками

Предположим, что в нашем CSV-файле есть заголовки:
Чтобы импортировать данные из этого файла, можно использовать формат CSVWithNames:
В этом случае ClickHouse пропускает первую строку при импорте данных из файла.
Начиная с версии 23.1, ClickHouse автоматически распознаёт заголовки в CSV-файлах при использовании формата CSV, поэтому использовать CSVWithNames или CSVWithNamesAndTypes не нужно.

CSV-файлы с пользовательскими разделителями

Если в CSV-файле в качестве разделителя используется не запятая, можно воспользоваться параметром format_csv_delimiter, чтобы указать нужный символ:
Теперь при импорте из CSV-файла в качестве разделителя будет использоваться символ ;, а не запятая.

Пропуск строк в CSV-файле

Иногда при импорте данных из CSV-файла требуется пропустить определённое количество строк. Это можно сделать с помощью настройки input_format_csv_skip_first_lines:
В этом случае мы пропустим первые десять строк CSV-файла:
В файле 1k строк, но ClickHouse загрузил только 990, так как мы указали пропустить первые 10.
При использовании функции file() в ClickHouse Cloud вам нужно запускать команды в клиенте ClickHouse на машине, где находится файл. Другой вариант — использовать clickhouse-local для локального изучения файлов.

Обработка значений NULL в CSV-файлах

Значения NULL могут кодироваться по-разному в зависимости от приложения, в котором был создан файл. По умолчанию ClickHouse использует \N в качестве значения NULL в CSV. Но это можно изменить с помощью параметра format_csv_null_representation. Предположим, у нас есть следующий CSV-файл:
Если мы загрузим данные из этого файла, ClickHouse будет интерпретировать Nothing как String (что верно):
Если мы хотим, чтобы ClickHouse считал Nothing значением NULL, это можно указать с помощью следующего параметра:
Теперь NULL находится именно там, где мы и ожидали его увидеть:

Файлы TSV (с разделителем табуляции)

Формат данных с разделителем табуляции широко используется для обмена данными. Чтобы загрузить данные из файла в формате TSV в ClickHouse, используется формат TabSeparated:
Существует также формат TabSeparatedWithNames, который позволяет работать с файлами в формате TSV с заголовками. И, как и в случае с CSV, можно пропустить первые X строк с помощью параметра input_format_tsv_skip_first_lines.

Неэкранированный TSV

Иногда файлы в формате TSV сохраняются без экранирования символов табуляции и переводов строки. Для обработки таких файлов следует использовать TabSeparatedRaw.

Экспорт в CSV

Любой формат из предыдущих примеров также можно использовать для экспорта данных. Чтобы экспортировать данные из таблицы (или из запроса) в формат CSV, используется то же предложение FORMAT:
Чтобы добавить строку заголовков в CSV-файл, используйте формат CSVWithNames:

Сохранение экспортированных данных в CSV-файл

Чтобы сохранить экспортированные данные в файл, можно использовать конструкцию INTO…OUTFILE:
Обратите внимание, что ClickHouse потребовалось ~1 секунды, чтобы сохранить 36 млн строк в CSV-файл.

Экспорт CSV с пользовательскими разделителями

Если нужно использовать разделители, отличные от запятой, можно воспользоваться параметром format_csv_delimiter:
Теперь ClickHouse будет использовать | как разделитель в формате CSV:

Экспорт CSV для Windows

Если нужно, чтобы CSV-файл корректно работал в среде Windows, стоит включить параметр output_format_csv_crlf_end_of_line. В этом случае в качестве перевода строки будет использоваться \r\n вместо \n:

Определение схемы для CSV-файлов

Во многих случаях приходится работать с неизвестными CSV-файлами, поэтому нужно определить, какие типы использовать для столбцов. ClickHouse по умолчанию пытается определить форматы данных на основе анализа указанного CSV-файла. Это называется “определением схемы”. Определённые типы данных можно просмотреть с помощью оператора DESCRIBE в сочетании с функцией file():
Здесь ClickHouse смог эффективно определить типы столбцов в нашем CSV-файле. Если мы не хотим, чтобы ClickHouse делал это автоматически, эту функцию можно отключить с помощью следующей опции:
В этом случае типы всех столбцов будут считаться String.

Экспорт и импорт CSV с явным указанием типов столбцов

ClickHouse также позволяет явно задавать типы столбцов при экспорте данных в формате CSVWithNamesAndTypes (и других форматов семейства WithNames):
Этот формат будет содержать две строки заголовка: одну с именами столбцов, другую — с типами столбцов. Это позволит ClickHouse (и другим приложениям) определять типы столбцов при загрузке данных из таких файлов:
Теперь ClickHouse определяет типы столбцов по (второй) строке заголовка, а не угадывает их.

Пользовательские разделители, разделители строк и правила экранирования

В сложных случаях текстовые данные могут быть оформлены весьма нестандартным образом, но при этом всё равно сохранять структуру. Для таких случаев в ClickHouse есть специальный формат CustomSeparated, который позволяет задавать пользовательские правила экранирования, разделители, разделители строк, а также начальные и конечные символы. Предположим, в файле есть следующие данные:
Мы видим, что отдельные строки заключены в row(), записи разделяются ,, а отдельные значения — символом ;. В этом случае мы можем использовать следующие настройки, чтобы читать данные из этого файла:
Теперь мы можем загрузить данные из нашего файла:
Мы также можем использовать CustomSeparatedWithNames, чтобы корректно экспортировать и импортировать строки заголовков. Ознакомьтесь с форматами regex and template, чтобы работать с ещё более сложными случаями.

Работа с большими CSV-файлами

CSV-файлы могут быть большими, и ClickHouse эффективно работает с файлами любого размера. Большие файлы обычно поставляются в сжатом виде, и ClickHouse поддерживает работу с ними без необходимости распаковки перед обработкой. При вставке можно использовать предложение COMPRESSION:
Если предложение COMPRESSION не указано, ClickHouse всё равно попытается определить сжатие файла по его расширению. Тот же подход можно использовать, чтобы экспортировать файлы напрямую в сжатые форматы:
Это создаст файл data_csv.csv.gz в сжатом формате.

Другие форматы

ClickHouse поддерживает множество форматов — как текстовых, так и двоичных, — для самых разных сценариев и платформ. Подробнее о других форматах и способах работы с ними читайте в следующих статьях: Также ознакомьтесь с clickhouse-local — это переносимый полнофункциональный инструмент для работы с локальными и удалёнными файлами без необходимости использовать сервер ClickHouse.
Последнее изменение 19 июня 2026 г.