自考13011人工智能与大数据考试大纲(2026年版)
【13011】 人工智能与大数据自学考试大纲浙江省教育考试院 2026 年 6 月自学用书:《大数据与人工智能》,郏东耀主编,清华大学出版社、北京交通大学出版社。
一、课程性质与设置目的
要求《大数据与人工智能》课程是面向信息技术、大数据技术、人工智能及相关专业学习者的一门 基础 与应 用结 合课 程 。 课程 以大 数据 技术 原理 为基 础 , 逐步 引入 Hadoop、HDFS、MapReduce、Spark、NoSQL、人工智能基础、机器学习、自然语言理解、 目标检测和智能交通等内容,体现技术基础、系统架构与行业应用的结合。
设置本课程的目的,是使自学应考者了解大数据与人工智能的发展背景、核心概念、关键技术和典型应用,掌握大数据采集、存储、处理、分析与智能应用的基本方法,形成用数据思维分析问题、用技术框架解决实际问题的能力。
学习本课程的要求,是在掌握基本概念和基本原理的基础上,重点理解各类技术组件之间的关系,能够结合业务场景进行分析和初步应用。书中个别产品版本、厂商时间线、代码细节和图表具体数值不作机械记忆要求,重点考核技术思想、系统流程、概念辨析和应用分析能力。
二、考核内容及目标
第 1 章大数据的来源、采集与基本概念
通过本章学习,了解大数据概念的产生背景、发展脉络和现实价值,掌握大数据的基本定义、 4V 特点、分类、采集流程与关键技术框架,为后续学习 Hadoop、数据存储与人工智能应用奠定
(1)大数据概念的来源及 Google GFS、MapReduce、Bigtable 等技术背景
(2)Hadoop、Spark、NoSQL 等大数据技术发展的基本线索
(3)大数据的定义、数据增长现象及数据价值
(4)大数据的 4V 特点:大、快、杂、疑
(5)大数据的分类、数据源及采集步骤
(6)大数据处理流程、关键问题与关键技术
1.识记:大数据、数据源、数据采集、流处理、并行化、摘要索引、可视化等概念;
Google 三驾马车、Hadoop、Spark、NoSQL 等名称及其基本含义;大数据 4V 特点及其英文含义。
2.理解:大数据从互联网业务、移动终端、传感器和行业系统中产生的原因;大数据与传统数据处理在规模、速度、类型和价值发现方式上的差异;数据采集、预处理、存储、分析和挖掘之间的关系。
3.简单应用:能够根据具体业务场景判断数据类型、数据来源和可采用的采集方式;能够用4V 特点分析电商、医疗、交通、社交网络等案例中的大数据现象。
4.综合应用:能够从数据产生、采集、存储、处理、分析、服务的链条出发,分析一个行业大数据应用的整体流程和关键风险。
大数据的定义、4V 特点、采集方法、处理流程及关键技术。
第 2 章大数据处理构架
Hadoop 通过 本章 学习 , 掌握 Hadoop 的产 生背 景 、 生态 体系 和核 心组 件 , 理解 Hive、HBase、Pig、ZooKeeper、YARN 等组件在大数据处理架构中的作用,能够从系统架构角度说明 Hadoop 解决海量数据存储和计算问题的思路。
(1)Hadoop 的诞生、发展及生态圈组成
(2)HDFS、MapReduce、YARN 在 Hadoop 中的基础地位
(3)Hive 的数据仓库功能和类 SQL 查询思想
(4)HBase 的列式、分布式和大数据仓库特征
(5)Pig 与 Pig Latin 的数据处理思想
(6)ZooKeeper 的协调服务作用
(7)Hadoop 资源管理与调度的基本机制
1.识记:Hadoop、Hive、HBase、Pig、ZooKeeper、YARN、MapReduce 等术语;
Hadoop
1.0 与
Hadoop 2.0 的基本区别;Pig Latin 的关系、包、元组、域等数据模式。
2.理解:Hadoop 由开源搜索引擎和 Google 论文思想发展而来的技术路径;Hive、Pig降低 MapReduce 编程复杂度的原因;ZooKeeper 在分布式系统中进行命名、配置、同步和协调的意义。
3.简单应用:能够根据任务特点选择 Hive、Pig、HBase 等组件进行数据查询、处理或存储;能够说明 YARN 在资源管理和任务调度中的基本作用。
4.综合应用:能够分析一个基于 Hadoop 的大数据平台中各组件的分工、数据流向和协同关系。
Hadoop 生态体系及 Hive、HBase、Pig、ZooKeeper、YARN 的作用与联系。
第 3 章 Hadoop 分布式文件系统 HDFS 通过本章学习,掌握分布式文件系统的基本思想和 HDFS 的体系结构,理解 HDFS 面向海量文件存储、高容错和高吞吐的设计原则,能够说明 HDFS 的读写流程、存储机制和可靠性保障方法。
(1)分布式文件系统的概念及 HDFS 的产生背景
(2)HDFS 的设计目标和适用场景
(3)NameNode、DataNode、Secondary NameNode 等架构组成
(4)数据块、副本、机架感知等核心机制
(5)HDFS 文件读写、上传、下载和容错流程
(6)异构存储与擦除码技术
1.识记:分布式文件系统、HDFS、NameNode、DataNode、数据块、副本、机架感知、擦除码等概念;HDFS 主要特性:高容错、高吞吐、适合大文件、采用块机制、流式数据访问。
2.理解:HDFS 采用主从架构和块存储机制的原因;副本机制、心跳机制和元数据管理对可靠性的作用;HDFS 与传统本地文件系统在访问方式和存储目标上的差异。
3.简单应用:能够画出或描述 HDFS 的基本架构和文件读写流程;能够根据应用场景判断HDFS 是否适合存储相应数据。
4.综合应用:能够分析 HDFS 在大数据平台中的存储瓶颈、可靠性策略和成本优化思路。
HDFS 架构、数据块与副本机制、文件读写流程及可靠性保障。
第 4 章 MapReduce 与 Spark通过本章学习,掌握 MapReduce 的并行计算思想、组成和执行流程,理解批处理计算中的 Map、 Shuffle、 Reduce 等环节 ,了解 Spark 与 RDD 的基本思想以及 Spark 相较于 MapReduce 在迭代、交互和内存计算方面的优势。
(1)MapReduce 的设计思想和函数式编程来源
(2)Map、Reduce、Shuffle、Combiner、Partitioner 等基本概念
(3)MapReduce 作业执行流程和通信开销
(4)典型 MapReduce 使用案例
(5)Spark 的产生背景、架构和优势
(6)RDD 的概念、特性与基本操作
1.识记:MapReduce、Map、Reduce、Shuffle、Spark、RDD、惰性计算、容错等概念;
MapReduce 与 Spark 的基本组成。
2.理解:MapReduce 将复杂任务分解为映射和归约的并行处理思想;Shuffle 和网络通信开销对计算效率的影响;Spark 适合迭代计算和交互式计算的原因。
3.简单应用:能够用 MapReduce 思想描述词频统计等简单并行计算过程;能够识别适合批处理或内存迭代计算的任务类型。
4.综合应用:能够比较 MapReduce 与 Spark 的适用场景,并为给定大数据计算任务选择合理框架。
MapReduce 工作流程、Shuffle 过程、Spark 的优势及 RDD 思想。
第 5 章 NoSQL 数据库、分布式数据库 HBase、云数据库通过本章学习,掌握数据库、NoSQL、分布式数据库、HBase 和云数据库的基本概念,理解关系数据库与非关系数据库的差异,能够说明 HBase 的数据模型和云数据库的应用价值。
(1)数据库与关系型数据库的基本概念
(2)NoSQL 的产生背景、特点及与关系数据库的区别
(3)NoSQL 数据库的体系框架和分类
(4)HBase 在 Hadoop 生态系统中的位置
(5)HBase 表、行键、列族、时间戳等数据模型
(6)云数据库的概念、系统架构和典型产品
1.识记:数据库、关系数据库、NoSQL、键值数据库、列族数据库、文档数据库、图数据库、HBase、云数据库等概念;HBase 的行键、列族、列修饰符、时间戳等术语。
2.理解:NoSQL 出现的背景及其在高并发、海量数据、灵活模式方面的优势;HBase 与HDFS、Hadoop 的关系;云数据库在弹性、可用性和运维方面的特点以及云数据库系统框架。
3.简单应用:能够根据数据结构和访问方式选择关系数据库、NoSQL 或 HBase;能够说明HBase 表设计中行键和列族选择的基本考虑。
4.综合应用:能够分析互联网业务中海量数据存储方案的选择依据,并说明云数据库部署的利弊。
NoSQL 与关系数据库比较、NoSQL 分类、HBase 数据模型和云数据库架构。
第 6 章大数据的
应用与展望通过本章学习,了解大数据在行业市场、企业发展、社会服务和商业智能中的应用方向,掌握大数据分析和挖掘的典型应用,能够从技术、产业和社会影响角度分析大数据未来发展趋势。
(1)大数据应用的行业方向和细分市场
(2)大数据推动企业发展的方式
(3)大数据成功应用案例
(4)大数据分析技术与挖掘技术应用
(5)大数据发展趋势、机遇与挑战
1.识记:商业智能、数据分析、数据挖掘、实时分析、精准分析、社交网络分析等概念;大数据应用的主要领域。
2.理解:大数据应用从存储计算走向行业分析服务的原因;大数据分析、挖掘和决策支持之间的关系;大数据应用带来的产业价值与治理挑战。
3.简单应用:能够概括金融、医疗、交通、电商、社交网络等领域的大数据应用方式;能够区分分析型应用和挖掘型应用。
4.综合应用:能够围绕某一行业提出大数据应用方案,并分析数据来源、分析目标、业务价值和风险控制。
大数据行业应用、分析挖掘场景、企业价值和未来趋势。
第 7 章人工智能的基本概念
通过本章学习,掌握人工智能的定义、研究对象、发展历史和经典思想实验,理解人工智能与计算机科学、认知科学、语言学等学科的交叉关系,能够对人工智能能力边界和未来发展进行初步分析。
(1)人工智能的定义、目标和学科特点
(2)人工智能的发展历史和重要阶段
(3)图灵测试的思想、过程和意义
(4)中文屋理论的观点及其争议
(5)人工智能未来发展方向与应用前景
1.识记:人工智能、机器智能、图灵测试、中文屋理论、强人工智能、弱人工智能等概念;
人工智能涉及的主要学科。
2.理解:人工智能模拟学习、推理、思考、规划等智能行为的基本目标;图灵测试与中文屋理论所讨论的智能判断标准;人工智能发展的技术推动因素和限制因素。
3.简单应用:能够用人工智能基本概念解释智能助手、自动驾驶、机器翻译等应用;能够比较不同智能判断观点的优缺点。
4.综合应用:能够结合现实应用讨论人工智能的能力、局限、伦理和未来发展方向。
人工智能定义、发展历史、图灵测试、中文屋理论及未来趋势。
第 8 章特征提取
通过本章学习,掌握特征提取和特征选择的基本思想,理解预测建模、数据表示、特征构建与模型性能之间的关系,了解图像特征的基本类型和提取方式,为机器学习与目标检测学习奠定
(1)预测建模与监督学习问题
(2)特征、属性、输入变量和数据表示
(3)特征构建、特征选择问题
(4)数学方法在特征处理中的作用
(5)图像特征、像素邻域、连通性、边缘、形状等概念
(6)特征选择的开放性问题
1.识记:特征、特征提取、特征选择、预测模型、训练样本、图像特征、连通性等概念;常见图像基础特征的名称。
2.理解:特征质量对机器学习模型泛化能力的影响;特征选择与降维、去噪、减少过拟合之间的关系;图像特征从像素、边缘、区域、形状等层次表达目标的方式。
3.简单应用:能够根据给定任务列举可能提取的特征;能够判断冗余特征、无关特征对模型训练的影响。
4.综合应用:能够为图像识别或分类任务设计基本特征提取思路,并说明其对模型效果的影响。
特征提取基础、特征选择和图像、纹理特征表达。
第 9 章机器学习
通过本章学习,掌握机器学习的定义、学习过程和基本类型,理解强化学习、推荐系统、神经网络和深度学习的基本思想,能够说明机器学习从数据、模型、训练到预测的基本流程。
(1)机器学习的定义、训练数据、模型和预测
(2)学习算法的性能评估、时间复杂度、空间复杂度和样本复杂度
(3)强化学习的奖励、状态、行动和策略思想
(4)推荐系统的基本任务和实现思路
(5)神经网络的基本组成
(6)深度学习的层次表达和特征学习
1.识记:机器学习、训练数据、模型、预测、强化学习、推荐系统、神经元、神经网络、深度学习等概念;监督学习、无监督学习、强化学习的基本区别。
2.理解:机器学习通过经验提升性能的机制;强化学习与有监督学习的差异;推荐系统利用用户行为和物品特征进行预测的逻辑;神经网络和深度学习的层次表达思想。
3.简单应用:能够根据问题类型判断适合采用分类、回归、聚类或推荐方法;能够解释一个简单机器学习任务中的训练数据、特征、模型和输出。
4.综合应用:能够分析一个实际应用中机器学习建模的流程,包括数据准备、模型训练、评估和应用反馈。
机器学习基本流程、强化学习、推荐系统、神经网络和深度学习思想。
第 10 章自然语言理解
通过本章学习,掌握自然语言、自然语言处理和自然语言理解的基本概念,理解语言认知模型、自然语言理解模型、汉语特点和思维规律,能够分析计算机处理文本、语义和人机交互的基本问题。
(1)自然语言、形式语言、机器语言的区别
(2)NLP 与 NLU 的概念和关系
(3)自然语言理解的目标与应用
(4)语言认知模型和自然语言理解模型
(5)语言及汉语的特点
(6)思维及思维规律特点
(7)计算机识字与理解的基本过程
1.识记:自然语言、自然语言处理、自然语言理解、语境、语义、语言认知模型、计算机识字等概念;文本分类、机器翻译、问答等应用名称。
2.理解:自然语言具有歧义、多样性、冗余性和动态变化的原因;NLP 与 NLU 在处理目标和理解深度上的差异;语言、认知、思维和语境在理解过程中的作用。
3.简单应用:能够举例说明自然语言歧义、语境依赖和汉语特点给计算机理解带来的困难;
能够说明文本分类、机器翻译等应用的基本处理目标。
4.综合应用:能够分析一个人机对话或文本理解系统需要解决的语言识别、语义理解、上下文建模和知识表示问题。
NLP 与 NLU 区别、语言认知模型、汉语特点、思维规律和计算机语言理解问题。
第 11 章人工智能方法在目标检测中的
应用通过本章学习,掌握目标检测、计算机视觉、智能视频监控和人脸识别的基本概念,理解人工智能方法在图像和视频分析中的应用流程,能够分析目标检测系统的组成模块、关键技术和实际应用价值。
(1)计算机视觉与目标检测的概念
(2)图像目标检测、定位、识别的基本任务
(3)智能视频监控系统的功能和技术模块
(4)场景建模、运动检测、目标分类、跟踪和行为理解
(5)人脸检测、人脸识别系统及其应用流程
1.识记:计算机视觉、目标检测、目标识别、智能视频监控、人脸检测、人脸识别、目标跟踪等概念;智能视频监控系统常见模块名称。
2.理解:目标检测是视频监控、人脸识别和场景理解基础技术的原因;智能视频监控从人工监看走向自动分析的技术逻辑;人脸识别系统中检测、特征提取、匹配和识别之间的关系。
3.简单应用:能够描述一个视频监控系统从视频采集到异常报警的基本流程;能够说明人脸识别系统中检测与识别的区别。
4.综合应用:能够针对多场景设计目标检测应用流程,并分析误检、漏检、隐私和数据质量问题。
目标检测任务、智能视频监控模块、人脸识别流程及应用分析。
第 12 章云计算、大数据与人工智能
通过本章学习,掌握云计算的基本概念和服务优势,理解云计算、物联网、大数据与人工智能之间的支撑关系,能够说明云平台在数据存储、计算、分析和机器学习中的作用。
(1)云计算的概念、服务模式和商业优势
(2)云计算的弹性、按需付费、资源池化和托管服务特点
(3)云端迁移、灾难恢复、开发测试和托管服务等用例
(4)云计算、物联网、大数据与人工智能的融合关系
1.识记:云计算、云服务、弹性服务、按需付费、混合云、物联网、大数据、人工智能等概念;云计算常见应用用例。
2.理解:云计算降低基础设施门槛并提升计算弹性的原因;物联网产生数据、大数据处理数据、人工智能利用数据、云计算提供资源之间的关系;云端迁移与混合环境的基本思路。
云计算概念、云服务优势及云计算与物联网、大数据、人工智能的融合。
第 13 章基于大数据的人工智能
应用通过本章学习,了解大数据与人工智能融合的典型应用,掌握自动编码器、信息量、多层神经网络、鲁棒性、对抗生成网络等基本思想,能够分析大数据如何推动深度学习和智能应用的发展。
(1)自动编码器的输入输出思想和多层神经网络基础
(2)全国天气推测局部天气、手写文字识别、Google 猫脸识别案例理解
(3)多层架构与深层特征学习
(4)鲁棒性对人工智能系统发展的意义
(5)对抗生成网络的基本思想
(6)大数据与人工智能融合对生活的影响和发展趋势
1.识记:自动编码器、信息量、多层架构、深度挖掘、鲁棒性、对抗生成网络、生成模型等概念;典型人工智能应用案例名称。
2.理解:自动编码器通过输入重构学习特征表示的基本逻辑;大数据规模与深度学习模型能力提升之间的关系;鲁棒性对模型泛化、抗干扰和实用化的重要性;对抗生成网络中生成与判别的基本思想。
3.简单应用:能够用自动编码器或深度学习思想解释手写数字、图像识别等简单应用;能够分析大数据在天气预测、图像识别、生活服务中的价值。
4.综合应用:能够围绕一个人工智能应用分析数据来源、特征学习、模型训练、鲁棒性和实际影响。
自动编码器、深度学习应用、鲁棒性、对抗生成网络及大数据与人工智能融合趋势。
第 14 章基于大数据的智能交通系统
通过本章学习,掌握智能交通系统的概念、组成技术和发展历程,理解大数据与交通系统结合的方式,能够分析交通数据采集、监测、预测和决策支持在智能交通中的作用。
(1)智能交通系统的概念和技术组成以及各国智能交通系统发展概况
(2)大数据与交通系统结合的方式
(3)大数据技术在智能交通中的应用
1.识记:智能交通系统、交通大数据、车辆监控、交通预测、交通管理等概念;智能交通涉及的自动控制、通信、计算机和信息技术。
2.理解:智能交通系统利用多种技术提高交通效率和安全性的原因;大数据在交通流监测、拥堵分析、事故预警和出行服务中的作用;不同国家和地区智能交通发展的基本特点。
智能交通系统概念、交通大数据应用和科学使用方法。
第 15 章大数据背景下机器学习算法实验
通过本章学习,掌握机器学习实验中的距离度量、聚类、回归、分类和决策树等基本算法思想,能够理解算法参数、训练、评估与实践示例,具备对简单机器学习实验进行分析和解释的能力。
(1)欧氏距离、曼哈顿距离、马氏距离、余弦距离
(2)聚类、回归、分类的概念和基本算法思想
(3)K-means 等聚类算法的基本流程
(4)决策树的节点、分裂、信息增益等基本概念
(5)机器学习实践示例中的训练、预测和评估
(6)算法实验中的参数选择和结果解释
1.识记:欧氏距离、曼哈顿距离、马氏距离、余弦距离、聚类、回归、分类、决策树、信息增益、训练集、测试集等概念;常见机器学习评价指标名称。
2.理解:不同距离度量反映相似性的方式和适用差异;聚类、回归、分类三类任务的区别;
决策树通过属性划分样本的思想;训练、预测、评价在实验流程中的作用。
3.简单应用:能够计算或判断简单二维样本的欧氏距离、曼哈顿距离或余弦相似性含义;能够根据任务目标区分聚类、回归和分类;能够解释决策树根节点、内部节点和叶节点的含义。
4.综合应用:能够分析一个简单机器学习实验的完整流程,包括数据准备、算法选择、模型训练、预测结果和评价指标解释。
距离度量、聚类/回归/分类区别、决策树原理和机器学习实验流程。
三、题型举例
(题型仅作参考,实际命题时不受此限制)
(一)单项选择题 2 分×15 题=30 分
1.下列选项中,不属于大数据 4V 特点的是( )。
A.大量 B.高速 C.多样 D.低成本参考答案:D(二)多项选择题 2 分×5 题=10 分
1.Hadoop 生态体系中常见的组件包括( )。
A.HDFS B.MapReduce C.Hive D.ZooKeeper E.YARN 参考答案:ABCDE(三)名词解释题 3 分×5 题=15 分
1.HDFS。
参考答案:HDFS 即 Hadoop 分布式文件系统,是用于在普通硬件集群上存储海量数据的分布式文件系统,具有高容错、高吞吐、适合大文件和流式访问等特点。
(四)简答题 5 分×4 题=20 分
1.简述 MapReduce 的基本工作思想。
参考答案要点:将大规模任务拆分为多个 Map 子任务并行处理;通过 Shuffle 对中间结果分组、排序和传输;由 Reduce 汇总得到最终结果;适合大规模离线批处理。
(五)论述题 10 分×1 题=10 分
1.试述云计算、大数据、物联网与人工智能之间的关系。
参考答案要点:物联网提供海量数据来源;大数据完成采集、存储、处理、分析和挖掘;人工智能利用数据训练模型并形成预测、识别和决策能力;云计算提供弹性计算、存储和部署环境 ;
四者共同支撑智能应用。
(六)案例分析题 15 分×1 题=15 分
1.某城市计划建设智能交通平台,实时采集车辆位置、道路视频、信号灯状态和事故报警信息。请分析该平台需要的大数据与人工智能关键环节。
参考答案要点:数据采集包括车辆、摄像头、传感器、业务系统等来源;存储可采用分布式文件系统、数据库或云平台;处理包括实时流处理和历史批处理;分析目标包括拥堵预测、车辆检测、异常事件识别和路径优化;人工智能应用包括目标检测、预测模型和决策支持;还需考虑隐私、安全、数据质量和系统可靠性。
