自考13011人工智能与大数据考试大纲(2025年版)
湖南省高等教育自学考试课 程考 试大 纲人工智能与大数据 (课程代码:13011) 南省教育考试院组编 2025 年 6 月高等教育自学考试课程考试大纲课程名称:人工智能与大数据课程代码:13011
第一部分课程性质与目标
一、课程性质与特点
人工智能与大数据是高等教育自学考试计算机科学与技术专业的选考课程。本课程具有前沿性、跨学科性及技术融合性三大特点,聚焦人工智能与大数据技术的理论基础、 核心算法及行业应用场景,为后续专业课程提供概念框架与方法论支撑。
二、课程目标与基本
要求通过学习本课程,考生应全面掌握人工智能与大数据技术的基本概念、原理及应用, 培养考生运用机器学习、深度学习等关键技术解决实际问题的能力,熟悉 TensorFlow 等开源平台的知识,为后续专业学习和行业实践打下坚实基础。考生需掌握相关技术的发展历程、现状及应用领域,理解关键技术的原理与算法,具备分析和解决实际问题的能力,能够进行简单的模型训练、评估和优化,以及对大数据进行分析和挖掘。同时,课程注重培养考生对新技术的敏感度和学习能力,增强信息素养和数据意识,提升跨学科思维和创新能力。
三、与本专业其他课程的关系
本课程为后续的专业课程(如机器学习、深度学习、数据挖掘等)奠定基础,帮助考生建立对人工智能与大数据技术的全面认识,为深入学习和应用提供理论支持。
第二部分考核内容与考核目标
第一章 人工智能概述
本章要求考生全面了解人工智能的定义、发展历程及其在现代社会中的广泛应用。
考生将通过学习,理解人工智能与其他学科的交叉关系,掌握人工智能技术的基本原理和发展趋势,为后续章节的学习奠定坚实的理论基础。
(一)人工智能的定义与分类(重点)识记:1.AI 是什么
2.AI 与云计算和大数据的关系理解:人工智能与其他学科的关系(二)人工智能的发展历程(重点)识记:AI 的历史发展理解:AI 的技术路线(三)人工智能的应用领域(次重点)
理解:国内 AI 现状
第二章 AI 产业
本章要求考生掌握人工智能产业的结构和特点,以及其在不同领域的应用情况。考生需要了解人工智能产业的基础层、技术层和应用层的具体内容及其相互关系,能够分析人工智能技术在金融、医疗、交通等领域的具体应用案例,理解这些应用如何推动传统行业的变革和创新。
(一)AI 产业(次重点)识记:1.基础层的主要内容
2.技术层的主要技术
3.应用层的应用领域(二)AI 产业发展趋势分析(次重点)
理解:人工智能产业的发展趋势
第三章 数据
本章要求考生理解大数据的特征、来源及其处理流程,掌握大数据技术的基本概念和应用方法。考生需要了解大数据的 4V 特征(体量大、类型多、速度快、价值密度低), 熟悉数据的采集、存储、处理和分析的基本方法,并理解大数据技术如何推动各行业的智能化发展。
(一)什么是大数据(次重点)识记:1.大数据的特征
2.大数据的交易难点理解:大数据的来源、计算模式(二)大数据技术(次重点)识记:1.数据技术的演进
2.分布式计算系统概述理解:大数据存储、计算和分析等基本数据平台(三)大数据产业(一般)
理解:大数据在金融、医疗、交通等领域的应用案例
第四章 机器学习概述
本章要求考生理解机器学习的基本概念及其在人工智能中的重要性。其中,机器学习基本概念是本章学习的重难点,需要重点攻克。考生需要掌握机器学习的基本流程, 包括数据预处理、模型选择、训练与评估等步骤。通过学习,理解机器学习在人工智能领域的核心地位及其与其他技术的关系。
(一)走进机器学习(重点)识记:1.什么是机器学习
2.机器学习的本质
3.对机器学习的全面认识理解:1.机器学习、人工智能与深度学习
2.机器学习、数据挖掘与数据分析应用:机器学习的感性认识(二)机器学习的基本概念(重点)识记:监督式学习和非监督式学习理解:数据集、特征和标签应用:机器学习的任务流程
第五章 模型
本章要求考生重点掌握机器学习模型的训练、评估及优化方法,理解模型过拟合与欠拟合的原因及其解决方法。其中,模型训练是学习的难点,具体包括理解模型、误差和 MSE 的概念,掌握模型训练的基本方法,明晰模型与算法的区别,以及理解梯度下降法等内容,需要重点攻克。考生需要了解模型训练的基本方法(如梯度下降法),熟悉模型评估的常用指标(如准确率、召回率、MSE)。通过学习,考生应能够分析过拟合与欠拟合问题。
(一)模型、误差、模型的训练和梯度的释法(重点)识记:什么是模型、误差和 MSE理解:1.模型训练的基本方法
2.模型与算法区别
3.梯度下降法
应用:给定一系列数据和标签,能够算出误差(二)模型的拟合效果和评估与改变(重点)识记:机器学习模型的评估理解:1.模型误差的概念
2.过度拟合与欠拟合定义
3.过度拟合处理方法应用:1.各种指标的计算
2.评估分析模型并且改进(三)机器学习的实现框架(一般)识记:Python、scikit-learn、SparkMLlib
第六章 机器学习算法
本章要求考生理解机器学习的基本概念和常见算法,掌握其原理和应用,能够根据实际问题选择合适的算法并解决相关问题。且需要熟悉机器学习的主要应用领域,如图像识别、自然语言处理、推荐系统等,能够解释这些算法的工作机制及其优缺点。
(一)线性回归与逻辑回归(重点)识记:1.线性回归形式与原理
2.逻辑回归形式与原理理解:1.线性回归与逻辑回归的区别
2.逻辑回归输出的概率意义应用:学会用线性回归解决简单数值预测问题(如房价预测),用逻辑回归处理二分类问题(如垃圾邮件识别)
(二)决策树(次重点)识记:决策树的结构理解:CART 决策树模型应用:构建决策树模型解决分类问题如鸢尾花种类识别。
(三)KNN(重点)识记:1.超参数 K
2.算法评价
理解:K 值对分类结果的影响应用:KNN 预测房价(四)支持向量机(重点)识记:核函数的作用理解:支持向量的定义应用:能够描述算法的流程,分析算法优劣(五)聚类算法(重点)识记:1.K 均值聚类
2.均值漂移聚类
理解:1.DBSCAN 算法
2.初始化质心的影响应用:能够描述算法的流程,分析算法优劣(六)集成学习(次重点)识记:1.集成算法之 Bagging
2.集成算法之 Boosting理解:1.Boosting 的代表算法
2.Adaboost 的作用
第七章 深度学习
本章要求考生理解深度学习基本概念与神经网络核心原理,掌握深度学习与传统机器学习区别。其中,深度学习和神经网络的训练是学习的难点,具体涉及深度神经网络相关知识、正向传播过程、激活函数的作用,以及梯度下降、反向传播和神经网络的参数等内容,需要重点攻克。同时,要熟悉 CNN 典型结构工作机制,理解正反向传播、激活函数及优化策略。
(一)走进深度学习(重点)识记:1.深度学习为何崛起
2.深度神经网络
理解:1.正向传播过程
2.激活函数的作用
(二)神经网络的训练(重点)识记:梯度下降和反向传播理解:神经网络的参数应用:利用反向传播进行简单的计算(三)神经网络的优化与改进(次重点)
理解:1.批量标准化的作用
2.正则化方法的原理(四)卷积神经网络(CNN)(重点)识记:1.卷积运算
2.池化层作用
理解:1.卷积核参数(大小、步长、填充)对输出的影响
2.CNN 适用于图像识别的原因应用:1.能够根据卷积核的参数计算卷积输出特征图的尺寸,能够掌握卷积与池化的计算过程
2.卷积神经网络识别 MINST 手写集实例.(五)深度学习框架与工具(一般)识记:常见框架(TensorFlow、PyTorch)的核心组件
第八章 TensorFlow本章要求考生掌握 TensorFlow 的基础架构以及简单的 python 代码。应用层面需理解从数据预处理到模型训练、调优及保存的完整流程,如房价预测、二分类等实际问题, 了解神经网络的基础搭建方法。其中,过度拟合处理是学习的难点,包括理解过度拟合的定义、表现、产生原因及对模型性能的影响,掌握训练集、测试集和验证集的划分原则,以及通过验证集评估模型泛化能力的方法等内容,需要重点攻克。
(一)TensorFlow 工具包(次重点)识记:1.了解 TensorFlow 架构的分层结构
2.python 基础语句应用:掌握简单的 python 数据处理语法,识别读懂简单 TensorFlow 代码(二)第一个 TensorFlow 程序(次重点)识记:加载数据、训练模型、评估模型、优化模型的基本方法理解:1.加州房屋销售数据的基本特征和预处理方法
2.模型训练过程中超参数(三)过度拟合处理(重点)识记:1.过度拟合的定义和常见表现
2.训练集、测试集和验证集划分原则理解:1.理解过拟合产生的原因及对模型性能的影响
2.掌握通过验证集评估模型泛化能力的方法应用:能够将数据集划分为训练集和验证集并给理由,学会通过观察训练误差和验证误差的变化判断模型是否过拟合。
(四)特征工程(次重点)识记:1.数值型、字符串型和分类数据的特征处理方法
2.好特征的基本标准理解:1.数据清洗的目的和常见方法
2.分箱(分桶)技术的作用和应用场景应用:能够对数据进行标准化和归一化处理
第九章 TensorFlow 高级知识通过本章的学习,考生应能结合 TensorFlow 来理解机器学习中的特征交叉、分桶(分箱)、L1/L2 正则化等技术。其中,特征交叉和 L1/L2 正则化是学习的难点,特征交叉需掌握其概念及对经纬度特征分箱并创建交叉特征的应用,L1/L2 正则化要牢记公式、核心目标,理解两者本质区别及正则化强度 λ 对模型的影响。同时,考生应能够理解逻辑回归模型的原理和应用,并掌握如何计算精确率、召回率、ROC 曲线等指标来评估分类模型的性能。
(一)特征交叉(重点)识记:什么是特征交叉应用:对经纬度特征进行分箱并创建交叉特征(二)L1 与 L2 正则化(重点)识记:1.L1 与 L2 正则化公式
2.正则化的核心目标理解:1.正则化强度 λ 对模型的影响(三)逻辑回归与分类(次重点)识记:1 逻辑回归的数学表达式
2.分类评价指标:精确率、召回率、ROC 曲线、AUC理解:1.Sigmoid 函数如何将线性组合映射为概率值
2.对数损失函数的推导逻辑与适用场景应用:能够计算出指标,构建 ROC 曲线图
第十章 神经网络
本章要求考生深入理解神经网络的基本原理和工作机制,考生需要熟悉神经网络的组成元素,如节点、权重、激活函数等,并理解它们在模型中的作用。其中,训练神经网络是学习的难点,需掌握正向传播与反向传播算法的基本步骤,理解梯度消失、爆炸及归一化相关知识,明晰参数正向传播、误差反向传播过程,以及理解超参数对模型性能的影响和 Dropout 的原理与作用。此外,考生还需要了解多类别神经网络与嵌入。
(一)什么是神经网络(重点)识记:1.神经网络隐藏层
2.激活函数
理解:1.不同激活函数的特点和适用场景激活函数如何引入非线性
2.特征交叉与独热编码结合使用的原理应用:能够根据问题选择合适的激活函数,并解释其选择理由(二)训练神经网络(重点)识记:1.正向传播算法基本步骤
2.反向传播算法基本步骤
3.梯度消失、爆炸
4.归一化
理解:1.参数正向传播的过程
2.误差反向传播的过程
3.梯度下降更新权重
4.超参数模型性能的影响
5.Dropout 的原理和作用应用:能够根据给定的数据集说出一个简单的神经网络训练流程,并解释每个步骤的作用(三)多类别神经网络(次重点)识记:1.一对多神经网络
2.Softmax 方程式理解:Softmax 如何将多分类问题转化为概率分布应用:给定一个简单神经网络或者数据结果,用 Softmax 来计算概率,判断归于哪一类(四)嵌入(一般)识记:1.协同过滤
2.稀疏数据
理解:嵌入技术在处理高维稀疏数据时的核心价值
第十一章 知识图谱
本章要求考生应了解知识图谱的基本概念、架构和构建技术。其中构建知识图谱是学习的难点,考生需掌握其定义、架构,理解通过实体、语义类、属性和关系构建知识体系的方式,明晰基于三元组的通用表示方式及意义,以及模式层与数据层在知识图谱中的作用。同时,考生需要掌握知识图谱的定义、构成要素以及逻辑结构和体系架构, 能够理解知识图谱在不同领域的应用场景和价值。此外,考生应熟悉知识图谱构建的关键技术,包括知识提取、知识融合、知识表示和知识推理。
(一)什么是知识图谱(重点)识记:1.知识图谱的定义
2.知识图谱的架构
理解:1.如何通过实体、语义类、属性和关系来构建知识体系
2.基于三元组的通用表示方式及其意义
3.模式层与数据层在知识图谱中的作用。
应用:能够根据给定的实体和关系,构建简单的知识图谱三元组,并解释其在知识表示中的作用。
(二)知识图谱构建的关键技术(次重点)识记:1.知识抽提取
2.语义抽取和关系抽取
3.知识表示与知识融合理解:不同构建方式的区别与联系
第十二章 数据挖掘
本章要求考生应掌握数据挖掘的基本概念、技术分类和常用方法,掌握数据挖掘与数据分析的区别,以及数据挖掘技术产生的背景和重要性。其中,数据挖掘常技术(方法)是学习的重点和难点,考生需掌握分类、聚类、回归分析、关联规则等方法的基本概念,理解不同方法的主要特点、应用场景和优缺点。同时,考生需要熟悉这些常用数据挖掘方法的特点和应用场景。此外,考生还应了解大数据思维,如信度与效度思维、 分类思维、漏斗思维等。
(一)什么是数据挖掘(重点)识记:数据挖掘技术产生的背景理解:数据挖掘与数据分析区别应用:能够根据给定的业务场景,判断是更适合使用数据挖掘还是数据分析(狭义)来解决问题其在知识表示中的作用。
(二)数据挖掘常技术(方法)(重点、难点)识记:分类、聚类、回归分析、关联规则等数据挖掘方法基本概念理解:不同数据挖掘方法的主要特点、应用场景和优缺点应用:能够根据给定的数据集和业务需求,选择合适的数据挖掘方法,并说明选择的理由。
(三)大数据思维(次重点)识记:信度与效度思维理解:1.每种大数据思维的核心要点和应用场景
2.不同构建方式的区别与联系应用:能够根据给定的业务场景,运用合适的大数据思维进行分析和决策
第十三章 银行业大数据与人工智能
本章要求考生应了解银行业大数据和人工智能的发展背景、应用领域和实践案例。
考生需要掌握四大行在大数据平台建设方面的具体措施和成果,理解大数据和人工智能如何帮助银行业提升竞争力。
(一)四大行的进展(次重点)识记:四大行大数据平台建设方面的具体措施和成果理解:银行大数据战略的思路和技术演进过程(二)金融宏观大数据分析(一般)识记:金融宏观大数据分析四个应用方向理解:如何通过大数据技术提供宏观决策支持
第十四章 医疗大数据与人工智能
本章要求考生应了解医疗大数据的特点、处理模型和 AI 应用。考生需要掌握医疗大数据的“4V”特点以及医疗领域特有的特征,理解这些特点对数据处理和应用的影响。
(一)医疗大数据的特点(次重点)识记:医疗大数据特点(二)医疗大数据处理模型(一般)
理解:医疗大数据处理模型每个部分的作用和相互关系(三)医疗大数据的 AI 应用(一般)识记:医疗大数据在 AI 应用中的重点领域理解:如何通过大数据和人工智能技术提升医疗服务的质量和效率
第十五章 公安大数据与人工智能
本章要求考生应了解公安大数据的特点、建设流程和 AI 应用。考生需要公安大数据的“4V”特点以及超复杂性、超保密性、强实时性等特征,理解这些特点对数据处理和应用的影响,并能够根据具体的公安业务场景设计合理的建设流程和应用方案。
(一)公安大数据的特点(次重点)识记:公安大数据的特点(二)公安大数据建设流程(一般)
理解:公安大数据建设环节的作用和相互关系(三)公安大数据的 AI 应用(一般)识记:公安大数据在 AI 应用中的重点领域理解:如何通过大数据和人工智能技术提升公安工作的效率和效果
第十六章 工农业大数据与人工智能
本章要求考生应了解医疗大数据的特点、处理模型和 AI 应用。考生需要掌握医疗大数据的“4V”特点以及医疗领域特有的特征,理解这些特点对数据处理和应用的影响。
(一)工业大数据(一般)识记:工业大数据制约因素理解:工业大数据发展趋势(二)农业大数据(一般)
理解:1.农业大数据发展现状
2.农业大数据目标
3.农业大数据建设任务
第三部分
有关说明与实施要求
一、考核的能力层次表述
本大纲在考核目标中,按照“识记”、“理解”、“应用”三个能力层次规定其应达到的能力层次要求。各能力层次为递进等级关系,后者必须建立在前者的基础上,其含义是:识记:能知道有关的名词、概念、知识的含义,并能正确认识和表述,是低层次的要求。
理解:在识记的基础上,能全面把握基本概念、基本原理、基本方法,能掌握有关概念、原理、方法的区别与联系,是较高层次的要求。
应用:在理解的基础上,能运用基本概念、基本原理、基本方法联系学过的多个知识点分析和解决有关的理论问题和实际问题,是最高层次的要求。
二、教材
1.指定教材
《人工智能与大数据技术导论》,杨正洪、郭良越,清华大学出版社,2019 年版
三、
自学方法指导
1.在开始阅读指定教材某一章之前,先翻阅大纲中有关这一章的考核知识点及对知识点的能力层次要求和考核目标,以便在阅读教材时做到心中有数,有的放矢。
2.阅读教材时,要逐段细读,逐句推敲,集中精力,吃透每一个知识点,对基本概念必须深刻理解,对基本理论必须彻底弄清,对基本方法必须牢固掌握。
3.在自学过程中,既要思考问题,也要做好阅读笔记,把教材中的基本概念、原理、方法等加以整理,这可从中加深对问题的认知、理解和记忆,以利于突出重点,并涵盖整个内容,可以不断提高自学能力。
4.完成书后作业和适当的辅导练习是理解、消化和巩固所学知识,培养分析问题、解决问题及提高能力的重要环节,在做练习之前,应认真阅读教材,按考核目标所要求的不同层次,掌握教材内容,在练习过程中对所学知识进行合理的回顾与发挥,注重理论联系实际和具体问题具体分析,解题时应注意培养逻辑性,针对问题围绕相关知识点进行层次(步骤)分明的论述或推导,明确各层次(步骤)间的逻辑关系。
四、对社会助学的要求
1.应熟知考试大纲对课程提出的总要求和各章的知识点。
2.应掌握各知识点要求达到的能力层次,并深刻理解对各知识点的考核目标。
3.辅导时,应以考试大纲为依据,指定的教材为基础,不要随意增删内容,以免与大纲脱节。
4.辅导时,应对学习方法进行指导,宜提倡“认真阅读教材,刻苦钻研教材,主动争取帮助,依靠自己学通”的方法。
5.辅导时,要注意突出重点,对考生提出的问题,不要有问即答,要积极启发引导。
6.注意对考生能力的培养,特别是自学能力的培养,要引导考生逐步学会独立学习,在自学过程中善于提出问题,分析问题,做出判断,解决问题。
7.要使考生了解试题的难易与能力层次高低两者不完全是一回事,在各个能力层次中会存在着不同难度的试题。
8.助学学时:本课程共 6 学分,建议总课时 108 学时,其中助学课时分配如下:
章次章节名称学时
第一章
人工智能概述
第二章
AI 产业
第三章
数据
第四章
机器学习概述
第五章
模型
第六章
机器学习算法
第七章
深度学习
第八章
TensorFlow
第九章
TensorFlow 高级知识
第十章
神经网络
第十一章
知识图谱
第十二章
数据挖掘
第十三章
银行业大数据和人工智能
第十四章
医疗大数据和人工智能
第十五章
公安大数据和人工智能
第十六章
工农业大数据和人工智能合计
五、关于命题考试的若干规定
1.本大纲各章所提到的内容和考核目标都是考试内容。试题覆盖到章,适当突出重点。
2.试卷中对不同能力层次的试题比例大致是:“识记”为 30%、“理解”为 40%、“应用”为 30%。
3.试题难易程度应合理:容易、中等、难比例为 3:4:3。
4.每份试卷中,各类考核点所占比例约为:重点占 60%,次重点占 30%,一般占10%。
5.试题类型一般分为:单项选择题、多项选择题、填空题、简答题、计算题。
6.考试采用闭卷笔试,考试时间 150 分钟,采用百分制评分,60 分合格。
六、题型示例(样题)
一、单项选择题
(本大题共 20 小题,每小题 1 分,共 20 分)在每小题列出的四个备选项中只有一个是符合题目要求的,请将其选出并将“答题卡”上的相应字母涂黑。错涂、多涂或未涂均无分。
1.下列机器学习算法属于集成学习方法的是A.线性回归 B.逻辑回归 C.随机森林 D.K 最近邻算法
二、多项选择题
(本大题共 5 小题,每小题 2 分,共 10 分)在每小题列出的五个备选项中至少有两个是符合题目要求的,请将其选出并将“答题卡”上的相应字母涂黑。错涂、多涂、少涂或未涂均无分。
21.下列关于机器学习模型训练的描述中,正确的有A.均方误差(MSE)用于衡量回归模型预测值与真实值的偏离程度 B.线性回归模型的表达式为 y = a0+ a1x,其中 a1是偏差项 C.模型训练的目标是找到使误差函数最小化的参数值 D.监督式学习中,训练集用于确定模型参数,测试集用于评估模型性能 E.误差函数仅包括均方误差一种形式
三、填空题
(本大题共 5 小题,每小题 2 分,共 10 分)
26.在多类别分类任务中,神经网络通过 Softmax 层输出各类别的概率分布,若某样本的 Softmax 输出为 [0.1, 0.7, 0.2],则该样本被预测为第________类(类别索引从 0 开始)。
四、简答题
(本大题共 5 小题,每小题 6 分,共 30 分)
31.简述机器学习中监督式学习和非监督式学习的主要区别。
五、计算题
(本大题共 2 小题,每小题 15 分,共 30 分)
36.一个二分类模型对 100 个测试样本的预测结果如下:真实正例中预测正确 60例,真实负例中预测正确 30 例,其余为错误预测。计算该模型的精确率、召回率和 F1 分数,并说明这些指标的含义。
