How to Migrate from Amazon S3 to Databricks
Skippr is the easiest way to migrate from S3 to Databricks and get fully cleansed and modeled data in one run command.
Source: S3. Destination: Databricks.
Sample config
yaml
skippr:
workspace: s3_to_databricks
pipelines:
s3_to_databricks:
data_source: data_sources.source
data_sink: data_sinks.warehouse
data_sources:
source:
S3:
s3_bucket: my-data-bucket
s3_prefix: "raw/"
data_sinks:
warehouse:
Databricks:
workspace_url: "${DATABRICKS_HOST}"
token: "${DATABRICKS_TOKEN}"
warehouse_id: "${DATABRICKS_WAREHOUSE_ID}"
catalog: main
schema: defaultEnvironment
bash
export DATABRICKS_HOST="https://myworkspace.cloud.databricks.com"
export DATABRICKS_TOKEN="dapi..."
export DATABRICKS_WAREHOUSE_ID="abc123def456"
export AWS_ACCESS_KEY_ID="your-key"
export AWS_SECRET_ACCESS_KEY="your-secret"Source connector: s3. Destination connector: databricks.
See Quick start.
