AWS SAA 题库

点击卡片任意位置翻面查看正确答案与解析,也可以用键盘 切换题目。

第 671 / 1018 题单选题

一个营销公司从一场营销活动中收到了大量的新的点击流数据,存储在Amazon S3中。该公司需要快速分析Amazon S3中的点击流数据。然后,公司需要确定是否在数据流水线中进一步处理这些数据。 哪种解决方案在操作开销最小的情况下满足这些要求?

  • A. 在Spark目录中创建外部表。配置AWS Glue作业以查询数据。
  • B. 配置AWS Glue爬虫来爬取数据。配置Amazon Athena以查询数据。
  • C. 在Hive元存储中创建外部表。在Amazon EMR中配置Spark作业以查询数据。
  • D. 配置AWS Glue爬虫来爬取数据。配置Amazon Kinesis Data Analytics使用SQL查询数据。
第 671 / 1018 题正确答案 B
  • B. 配置AWS Glue爬虫来爬取数据。配置Amazon Athena以查询数据。

解析

选项 B 提供了一个操作开销相对较小的解决方案。使用AWS Glue爬虫可以轻松地发现和分类S3中的数据,而Amazon Athena则可以通过SQL查询对数据进行分析,而不需要创建额外的计算集群。 选项 A 和 C 中都包括使用Spark或EMR等工具,这可能涉及更多的操作和资源配置,因此操作开销相对较大。 选项 D 中涉及Amazon Kinesis Data Analytics,这通常用于流式数据处理,但在这个情况下,只需要查询静态的Amazon S3数据,因此可能是一种过度的复杂性。 因此,选项 B 是在操作开销最小的情况下满足要求的解决方案。

AI 解析

AWS服务中,AWS Glue爬虫能够自动检测S3数据格式并生成元数据,将结构信息存入Glue Data Catalog。Amazon Athena作为无服务器查询服务,可直接通过SQL分析S3数据而无须预置资源。选项B结合两者,无需维护基础设施,自动完成数据目录构建和按需查询,操作步骤最少。选项A涉及Glue ETL作业,更适合转换处理而非即时查询。选项C依赖EMR集群管理,运维成本高。选项D的Kinesis适用于实时流而非静态S3数据分析。参考AWS官方文档对Athena和Glue的说明,无服务器架构显著降低管理负担。