AWS SAA 题库

点击卡片任意位置翻面查看正确答案与解析,也可以用键盘 切换题目。

第 213 / 1018 题单选题

一家公司的报告系统每天向Amazon S3存储桶传送数百个.csv文件。公司必须将这些文件转换为Apache Parquet格式,并将文件存储在转换后的数据存储桶中。哪种解决方案可以以最少的开发工作来满足这些要求?

  • A. 创建一个安装了Apache Spark的Amazon EMR集群。编写一个Spark应用程序来转换数据。使用EMR文件系统(EMRFS)将文件写入转换后的数据存储桶。
  • B. 创建一个AWS Glue爬虫来发现数据。创建一个AWS Glue抽取、转换和加载(ETL)作业来转换数据。在输出步骤中指定转换后的数据存储桶。
  • C. 使用AWS Batch创建一个作业定义,其中包含Bash语法来转换数据并将数据输出到转换后的数据存储桶。使用作业定义来提交作业。将数组作业指定为作业类型。
  • D. 创建一个AWS Lambda函数来转换数据并将数据输出到转换后的数据存储桶。配置S3存储桶的事件通知。将Lambda函数指定为事件通知的目标。
第 213 / 1018 题正确答案 B
  • B. 创建一个AWS Glue爬虫来发现数据。创建一个AWS Glue抽取、转换和加载(ETL)作业来转换数据。在输出步骤中指定转换后的数据存储桶。

解析

AWS Glue是AWS提供的一种ETL(抽取、转换和加载)工具,专门用于处理数据转换和数据湖建设。选项B中,使用AWS Glue的方式可以最大程度减少开发工作,因为它提供了ETL作业的自动化。你只需配置Glue爬虫来发现数据,然后创建一个ETL作业来转换数据,最后指定转换后的数据存储桶作为输出位置。这种方法相对来说更简单且节省时间,不需要自己管理集群或编写复杂的代码。 其他选项涉及到更多的自定义开发工作,如创建EMR集群、编写Spark应用程序(选项A),使用AWS Batch和Bash脚本来处理(选项C),或使用Lambda函数和S3事件通知(选项D)。这些方法需要更多的开发和配置工作,不如AWS Glue提供的自动化方式来得方便。

AI 解析

这道题主要考察AWS数据处理服务的使用场景和效率比较。AWS官方文档强调AWS Glue作为无服务器ETL服务的优势,包括自动数据目录管理、内置转换功能。选项B的AWS Glue通过爬虫自动发现S3数据并生成元数据,ETL作业可直接配置数据格式转换(如CSV到Parquet),无需编写复杂代码,符合最小开发投入需求。选项A涉及EMR集群管理和Spark应用程序开发,选项C需要自定义脚本处理数据格式,选项D存在Lambda处理大文件的时间限制和并发问题,均不如Glue自动化程度高。