人工智能工程技术人员五级初级工-人工智能平台产品实现 详细题库
下载APP练习大数据技术的基础知识 题目预览
-
第 1 题 单选题大数据通常被视为具有“4V”特征,其中“多样性”指的是数据( )。
- A. 种类繁多
- B. 产生速度快
- C. 规模巨大
- D. 价值密度低
解析:大数据的“多样性”是指数据类型和来源的多样化,包括结构化、半结构化和非结构化数据。 -
第 2 题 单选题在大数据技术中,Hadoop分布式文件系统(HDFS)的核心设计思想是将文件( )存储。
- A. 在单台服务器上并行
- B. 以块的形式分散在多台节点上
- C. 以记录为单位顺序
- D. 通过数据库索引优化
解析:HDFS将大文件分割成固定大小的块(默认128MB),并将这些块副本分布到集群中的不同节点上,实现高吞吐量访问和容错。 -
第 3 题 单选题在大数据基础概念中,数据仓库通常用于( )。
- A. 存储原始实时数据流
- B. 支持在线事务处理(OLTP)
- C. 支持在线分析处理(OLAP)和决策支持
- D. 替代关系型数据库进行日常操作
解析:数据仓库专门设计用于查询和分析大量历史数据,以支持管理决策,属于OLAP系统,与面向事务的OLTP不同。 -
第 4 题 单选题下列关于数据生命周期的描述,正确的是数据经过采集、存储、处理、分析后,最终( )。
- A. 永久保留所有数据
- B. 立即删除原始数据
- C. 归档或销毁以释放资源
- D. 全部转化为可视化报表
解析:数据生命周期包括创建、存储、使用、共享、归档和销毁等阶段。在分析结束后,不再需要的数据通常会被归档或安全销毁,以节省存储成本并满足合规要求。 -
第 5 题 判断题大数据技术中的MapReduce编程模型只能用于批处理计算,无法支持实时流处理。
- A. 对
- B. 错
解析:MapReduce设计为面向大规模数据的批量处理框架,其处理模式基于离线作业,不适合毫秒级的实时流计算场景(如Apache Storm或Flink更适合实时处理)。 -
第 6 题 判断题数据湖与数据仓库的主要区别在于数据湖存储原始格式的数据,而数据仓库存储经过清洗和转换的结构化数据。
- A. 对
- B. 错
解析:数据湖以原生格式存储各种类型的数据(结构化、半结构化、非结构化),通常用于探索和机器学习;数据仓库则对数据进行ETL后存储,主要用于业务分析和报表。 -
第 7 题 多选题下列选项中,属于大数据“4V”特征的是( )。
- A. 大量(Volume)
- B. 高速(Velocity)
- C. 价值(Value)
- D. 多样(Variety)
- E. 虚拟(Virtual)
解析:大数据的“4V”特征通常指大量(Volume)、高速(Velocity)、多样(Variety)和价值(Value)。虚拟(Virtual)不是标准特征。 -
第 8 题 多选题在大数据生态系统中,常见的分布式计算框架或引擎包括( )。
- A. Apache Hadoop MapReduce
- B. Apache Spark
- C. MySQL
- D. Apache Flink
- E. Apache Kafka
解析:MapReduce、Spark和Flink都是分布式计算框架;MySQL是关系型数据库,Kafka是分布式消息队列,虽然常用于大数据管道,但本身不是计算引擎。
余下详情题库请下载 APP 或扫码小程序查看全部题目与智能刷题。