Usage
Deployed Resources
Once deployed, you should see the following in your AWS account:
Naming convention: <org>-<env>-<domain>-<module>-<resource>
SSM parameters: /<org>/<domain>/<module>/<resource-type>/<resource-name>/<attribute>
| Resource | Deployed Name / SSM Path | Config Reference |
|---|---|---|
| S3 Bucket | <org>-dev-shared-datalake-raw/<org>/shared/datalake/bucket/raw/name |
buckets.raw in datalake/datalake.yaml |
| S3 Bucket | <org>-dev-shared-datalake-transformed/<org>/shared/datalake/bucket/transformed/name |
buckets.transformed in datalake/datalake.yaml |
| SageMaker Studio Domain | <org>-dev-datascience-example-team/<org>/datascience/example-team/domain/example-team/name |
example-team in datascience/datascience-team.yaml |
| Athena Workgroup | <org>-dev-shared-athena/<org>/shared/athena/workgroup/name |
configured in datalake/athena.yaml |
| Glue Crawler | <org>-dev-dataops-example-crawler-crawler1/<org>/dataops/example-crawler/crawler/example-crawler/name |
crawlers.crawler1 in dataops/crawler.yaml |
| Glue Database | <org>-dev-dataops-example-project-sample-database/<org>/dataops/example-project/database/name |
databases.sample-database in dataops/project.yaml |
| IAM Role | <org>-dev-shared-roles-data-admin/<org>/shared/generated-role/data-admin/id |
generateRoles.data-admin in roles.yaml |
| IAM Role | <org>-dev-shared-roles-data-user/<org>/shared/generated-role/data-user/id |
generateRoles.data-user in roles.yaml |
| IAM Role | <org>-dev-shared-roles-data-scientist/<org>/shared/generated-role/data-scientist/id |
generateRoles.data-scientist in roles.yaml |
| IAM Role | <org>-dev-shared-roles-glue-etl/<org>/shared/generated-role/glue-etl/id |
generateRoles.glue-etl in roles.yaml |
| IAM Role | <org>-dev-datascience-roles-team-execution/<org>/datascience/generated-role/team-execution/id |
generateRoles.team-execution in roles.yaml (datascience domain) |
Post-Deployment Steps
Upload Sample Data
- Check DATASETS.md to create a
sample_datafolder with test CSV files. - Assume the
<org>-dev-shared-roles-data-adminrole (only this role has write access to data lake buckets). - Upload sample data to the transformed bucket:
Catalog Data
- Navigate to the AWS Glue Console and trigger the deployed Glue Crawler.
- Monitor CloudWatch Logs to confirm tables were created successfully.
Query Data via Athena
- Assume the
<org>-dev-shared-roles-data-userrole. - Open the Amazon Athena Query Editor.
- Select the MDAA-deployed Workgroup from the workgroup dropdown.
- Query tables under the MDAA-created Database.
Launch SageMaker Studio
- Assume the
<org>-dev-shared-roles-data-scientistrole. - Navigate to the SageMaker AI Domain console.
- Launch the user profile matching your role session name or userid.
- SageMaker Studio will open with notebooks and kernels ready to use.