第十四章 大数据与数据科学
本次考试考查第十四章大数据与数据科学的相关知识,请独立完成作答。
1. 您的姓名:
第一部分 单选题,每题1分
2. 当您不一定要提出特定问题时,您需要发现可能的关系或以探索的方式显示数据模式。您将使用哪种数据工具通过各种算法来实现数据模式?
数据质量剖析
ETL作业
数据可视化工具
数据挖掘
3. 数据科学的过程(活动)中,下列哪项不属于其中之一?
定义大数据战略和业务需求
制定数据假设和方法
预测性分析
部署和监控
4. 传统数据仓库(DW)与大数据处理之间最大的区别在于哪项技术?
ODS
ELT
SOA
CDC
5. 从大量非结构化或半结构化数据中检索并获得见解的自动化方法,用于感知人们对品牌、产品、服务或其他类型主题的感觉和看法,这种方法是指:
语义分析
机器学习
预测分析
文本挖掘
6. Azure的数据湖包括一切使得开发者、数据科学家、分析师能更简单的存储、处理数据的能力,这些能力使得用户可以存储任意规模、任意类型、任意产生速度的数据,并且可以跨平台、跨语言的做所有类型的分析和处理。数据湖在能帮助用户加速应用数据的同时,消除了数据采集和存储的复杂性,同时也能支持批处理、流式计算、交互式分析,以下在数据湖应用场景叙述有误的是?
数据科学家可以挖掘和分析数据的环境
原始数据的集中存储区域,需要时进行大量的转换
数据仓库明细历史数据的备用存储区域
信息记录的在线归档
7. 机器学习探索了学习算法的构件,以下选项属于机器学习算法的是:
深度学习
强化学习
联邦学习
以上选项都不正确
8. 数据科学中RFID是自动识别技术的一种,通过无线射频方式进行非接触双向数据通信,利用无线射频方式对记录媒体(电子标签或射频卡)进行读写,从而达到识别目标和数据交换的目的,其被认为是21世纪最具发展潜力的信息技术之一。随着数据科学技术的发展,可视化的管理日益成熟,以下关于可视化渠道管理叙述有错的是?
成功实现数据科学的方法因素,是为用户团体提供可视化工具
确保用户了解可视化工具的复杂性
用于可视化的元素不会影响下游工具效果
企业架构对于控制项目组合内部和整个项目组合中的可视化通道是必要的
9. 数据可视化通过视觉概览(如图表或图形)来帮助理解基础数据,数据可视化压缩并封装特征数据,使其更易于查看,下列关于数据可视化的分析错误的是?
可视化一直是数据分析的最关键环节
数据可视化可以以静态格式(如已发布的报告)或更有交互性的在线格式交付
有助于发现商机,识别风险或凸显信息
要特别考虑误导性可视化可能引发的相关风险
10. 在机器学习中有关于学习算法的类型描述哪项是错误的?
识别学习
监督学习
无监督学习
强化学习
11. 以下选项中不属于数据挖掘经常使用的技术是:
剖析(Profiling)
向上卷积(Roll-up)
数据缩减(Data reduction)
自组织映射(Self-organizing maps)
12. 数据湖是一种可以提取、存储、评估和分析不同类型和结构海量数据的环境,可供多种场景使用。下列哪项不属于上述使用场景之一?
数据科学家可以挖掘和分析数据的环境
数据质量干预
可以通过自动化的模型识别提取流数据的环境
数据仓库明细历史数据的备用存储区域
13. 开发数据科学解决方案,包括将数据源迭代地整合到开发洞察力的模型中。因此下列不属于数据科学依赖的是?
丰富的数据源。具有能够展示隐藏在组织或客户行为中不可见模式的潜力
信息组织和分析。用来领会数据内容,结合数据集针对有意义模式进行假设和测试的技术
展示发现和数据洞察
信息输入
14. 大数据使用的处理工具有()
MPP
数据血缘工具
数据库技术
ODS
15. 在数据科学和可视化交付过程中,为避免出现偏颇的结果,确保公平一致的方式完成所有要素,以下哪项不包括在内:
数据包含和排除
模型中的假设
请求新数据
结果的统计有效性
16. 可以进行业务决策可信源的数据是()
模型
信息
知识
洞察
17. 预测分析(Predictive Analytics)是有监督学习的子领域,用户尝试对数据元素进行建模,并通过评估概率估算来预测未来结果。关于预测分析的描述错误的是?
预测分析与无监督学习拥有许多相同的组成部分,对预期预测结果进行测量时差异是可控的
预测分析是基于可能事件(购买、价格变化等)与可变因素(包括历史数据)的概率模型开发
预测模型在做出预测和被预测的事件发生之间提供的时间通常不短
预测模型的最简单形式是预估
18. 大数据和数据科学计划的实施与任何开发项目一样,应与实际业务需求保持一致,下列关于评估关键成功因素相关的组织准备情况叙述有误的是?
培养内部人才的时间可能会超过交付窗口的时间
数字资料存储的来源都需要内部拥有和运营
市场有许多工具和技术,满足一般需求是一个挑战
保护具有专业技能的员工,并在实施过程中留住顶尖人才
19. 某企业反映其数据库响应时间太慢,虽然增加了计算平台投入,仍然要花费数小时甚至好几天才能完成某项大规模表的计算,对此,你应该推荐该企业使用如下哪种工具或技术予以改善:
ERP
MPP
ECM
数据可视化
20. 基于服务的体系结构(SBA)包括三个主要的组件,下列哪项不是?
批处理层
源数据层
服务层
加速层
21. MapReduce模型有三个主要步骤:
剖析、关联、聚类
提取、转换、加载
映射、修正、转换
映射、洗牌、归并
22. 数据仓库和数据湖在各个方面各有千秋,数据仓库主要处理历史的、结构化的数据,而数据湖可以处理怎样的数据?
所有类型的数据
半结构化的数据
结构化的数据
非结构化的数据
23. 关于数据仓库和数据湖的主要差别,以下哪项描述是不正确的。
存储数据类型和数据结构化流程不同
主要提供的服务不同
面向主要用户不同
应用侧重点不同
24. 一般来说,提升一个组织大数据和数据科学能力的最大业务驱动力是:
维护组织数据完整性,确保数据安全
管理数据资产,以期实现数据资产交易价值
把数据作为组织业务管理解决依据,防范市场风险
利用数据进行预测性、规范性分析,以发现更大的商机
25. 大数据是指数据量大,以下哪项能表达数据量大的特征
1PB
100TB-1EB
大于100万条数据
大于1000万条数据
26. 21世纪以来,大数据和数据科学成为时髦的词语,但人们往往会误解这些词语和它们的含义, 或者说人们对它们含义的理解还没有达成共识,下列描述说法错误的是?
数据科学家已经找到了分析数据和从数据中获取价值的新方法
大数据使用不同种类的数据源,实现预测能力、基于模型的实时分析能力,能够为组织未来的发展方向提供更深刻的洞察能力
大多数数据仓库依赖于ELT(提取、转换和加载)的概念。大数据解决方案,如数据湖,则依赖于ETL的概念——先加载后转换
数据的生产速度和容量带来了挑战,需要在数据管理的各个关键领域中采用不同的方法,如集成、元数据管理和数据质量评估
27. 服务化架构(SBA:Service-based Architecture)是第五代移动通信系统(5G)的重要特征,结合移动核心网的网络的特点和技术发展趋势,将网络功能划分为可重用的若干个“服务”。“服务”之间使用轻量化接口通信。其目标是实现5G系统的高效化、软件化、开放化。这个架构包括三个重要的组件,以下不属于的是?
批处理层
加速层
服务层
流处理层
28. 大数据管理应仔细管理(),以便对数据文件及其来源和价值进行准确的清单管理
数据
元数据
数据模型
主数据
关闭
更多问卷
复制此问卷