Назначение Amazon S3
Renta записывает данные из любого подключённого источника в ваш бакет Amazon S3 в виде Parquet-объектов, раскладывает их по папке на пайплайн и обновляет на каждом запуске.
Файлы Renta загружает сама через API AWS. Ничего в бакете не нужно открывать наружу, входящий доступ к вашей инфраструктуре не задействован.
Требования
Подключению нужны учётные данные IAM, уже созданный бакет и регион, в котором этот бакет лежит.
- Пользователь IAM с правами на бакет.
Renta просматривает, загружает, читает и удаляет объекты внутри своих папок, а это праваs3:ListBucket,s3:PutObject,s3:GetObjectиs3:DeleteObject. - Существующий бакет.
Renta не создаёт бакет. Она создаёт только папки внутри него. - Правильный регион.
Подключение подписывает запросы для одного региона. Бакет в другом регионе отвалится так же, как при нехватке прав.
Подключение Amazon S3 в качестве назначения
Подключение хранит один бакет, один регион и ключи доступа, которыми Renta подписывает запросы.
- В консоли Renta откройте Connections > Catalog в левом меню.
- Разверните категорию Data lake и нажмите карточку Amazon S3.

Заполните учётные данные пользователя IAM, которого вы подготовили:
- AWS Access Key.
Идентификатор ключа доступа пользователя IAM. - AWS Secret Access Key.
Секрет, который показывается один раз при создании пары ключей. - AWS Bucket Name.
Бакет, в который пишет Renta. Укажите голое имя безs3://и без пути.

- AWS region.
Начните печатать название города или идентификатор региона, чтобы сузить список. - Нажмите регион, которому принадлежит бакет. Под названием каждого варианта подписан его идентификатор, например
eu-central-1.

Заполните Destination name (название используется только внутри консоли Renta) и нажмите Save.
По нажатию Save Renta проверяет, что бакет существует и отвечает на переданные ключи в выбранном регионе. Неверные ключи, чужой регион или опечатка в имени бакета вернут ошибку сразу, а не на первом запуске пайплайна.

Подключение появится в списке Destinations со статусом Active и будет готово к использованию в пайплайнах.

Создание пайплайна в Amazon S3
Ниже показан Stripe, но для любого другого источника порядок такой же.
В левом меню нажмите New pipeline. Оставьте выбранной вкладку ETL, выберите источник в блоке Already connected и нажмите Next step.

Выберите подключение, из которого нужно читать данные, и нажмите Next step.

На шаге Destination выберите Amazon S3 в блоке Already connected и нажмите Next step.

Выберите подключение S3, в которое пойдёт запись, и нажмите Next step. На карточке показаны имя бакета и его регион, это помогает, когда в воркспейсе несколько бакетов.

Настройка пайплайна
Последний шаг мастера собирает все настройки пайплайна в одну длинную форму. Верхняя часть формы относится к источнику, остальное работает одинаково для любого назначения.
Настройки источника
Первый блок определяет, что именно извлекать. Его состав зависит от источника, у Stripe он начинается с типа отчёта.

Дальше отметьте поля, которые нужно загружать. Каждое выбранное поле станет колонкой внутри Parquet-файлов, а невыбранные поля не записываются вовсе.

Под каждым полем подписано, как будет называться его колонка. Кнопка Select All отмечает весь список сразу.
Имя интеграции и папки
Второй блок задаёт название пайплайна в Renta и имя папки в бакете.

- Integration name.
Отображаемое название пайплайна в консоли Renta. - Table name.
Для дата-лейка это имя папки внутри бакета. Оставьте сгенерированное имя или введите своё.
Папку Renta очищает, перебирая всё под её префиксом, поэтому папка stripe захватывает и stripe_invoices. Задавайте пайплайнам такие имена папок, чтобы одно не было началом другого, иначе полная перезагрузка короткой папки сотрёт длинную.
Диапазон дат
Диапазон дат задаёт, сколько истории загрузит первый запуск и насколько далеко назад уйдёт ручная перезаливка.

- Date start.
Первый день периода выгрузки. - Date end.
Последний день: фиксированная дата или подвижная граница, например Today.
Ручной запуск Full refresh со страницы пайплайна загружает весь этот период заново.