机器学习相关术语都有哪些,什么是过拟合?
- 云服务器
- 2026-08-12
- 6
机器学习相关术语是理解算法原理与模型调优的基石,掌握它们能让你快速上手并精准解决实际问题。
机器学习相关术语基础:数据与模型
数据集与特征术语
在机器学习项目中,数据是原材料,你需要熟悉三个核心概念:训练集用于学习参数,验证集用于调参,测试集用于最终评估,三者不能混用,否则模型会“科技”,特征工程是另一组关键术语,包括标准化(将数据缩放至均值为0、方差为1)和归一化(缩放到0-1区间),以及针对类别变量的独热编码,这些操作直接影响模型收敛速度与精度。
- 特征选择:从原始变量中筛选出对目标最有解释力的子集,常用方法包括过滤法、包裹法和嵌入法。
- 特征提取:通过变换创造新特征,例如主成分分析(PCA)将高维数据降维,保留主要信息。
模型类型术语
机器学习分为两大阵营:监督学习使用标注数据,目标是预测标签;无监督学习无标签,目标是发现结构,在监督学习中,回归预测连续值(如房价),分类预测离散类别(如垃圾邮件检测)。半监督学习和强化学习也是常见术语,前者利用少量标注加大量未标注数据,后者通过奖励机制学习策略。
模型训练与评估术语:如何判断模型好坏
损失函数与优化器
损失函数量化模型预测与真实值的差距,回归任务常用均方误差(MSE),分类任务常用交叉熵损失,优化器负责更新参数,梯度下降是最基础的算法,它沿损失函数的负梯度方向移动。学习率控制步长,过大导致震荡,过小收敛过慢,实践中常用Adam等自适应优化器,它们能自动调整学习率。
过拟合与欠拟合
过拟合指模型在训练集上表现极好,但在新数据上泛化差,常见于参数过多或数据太少。欠拟合则是模型连训练数据都学不好,通常因为容量不足,应对过拟合的术语包括
正则化(L1/L2惩罚项)、Dropout(随机丢弃神经元)和早停法(验证集性能不再提升时停止训练)。交叉验证(如K折交叉验证)能更稳健地评估模型,避免一次性划分带来的偏差。
评估指标术语
针对分类任务,混淆矩阵是基础,包含真正例(TP)、假正例(FP)、真反例(TN)、假反例(FN),由此衍生出:
- 准确率:所有预测中正确的比例,但在类别不平衡时可能误导。
- 精确率:TP / (TP + FP),关注“预测为真的样本中有多少是真正的真”。
- 召回率:TP / (TP + FN),关注“真正的真样本中有多少被识别出来”。
- F1分数:精确率和召回率的调和平均,平衡两者。
- ROC曲线与AUC:ROC曲线展示不同阈值下的真正率与假正率,AUC是曲线下面积,值越大分类器越优秀。
对于回归任务,R²分数和平均绝对误差(MAE)是常用术语。
进阶术语:神经网络与深度学习
神经元与激活函数
人工神经元模拟生物神经元,接收输入后加权求和并通过激活函数输出。激活函数引入非线性,常见的有:ReLU(线性整流单元,避免梯度消失但可能导致神经元死亡)、Sigmoid(映射到0-1,适合二分类输出层)、Tanh(零中心,梯度更强)。Softmax用于多分类输出层,将logits转换为概率分布。
网络结构术语
多层感知机(MLP)是最基础的神经网络,包含输入层、隐藏层和输出层。卷积神经网络(CNN)擅长处理网格结构数据(如图像),核心术语包括卷积核、池化层和步长。循环神经网络(RNN)处理序列数据(如文本),但易出现梯度消失/爆炸,长短期记忆网络(LSTM)和门控循环单元(GRU)通过门控机制缓解,近年来注意力机制和Transformer

成为主流,其核心是自注意力与位置编码。
训练技巧术语
批量归一化(Batch Normalization)对每一层输入做标准化,加速训练并提高稳定性。Dropout在训练时随机丢弃部分神经元,防止过拟合。学习率调度(如余弦退火、阶梯下降)动态调整学习率。权重初始化(如Xavier初始化、He初始化)决定参数起始点,影响收敛速度。
选择基础设施支持机器学习工作负载
计算资源需求与部署选项
训练深度学习模型需要高性能计算资源,尤其是GPU,许多团队选择云服务器或IDC托管方案,因为自建机房成本高且维护复杂,关键考虑因素包括:GPU算力、内存带宽、存储IOPS以及网络延迟,对于数据敏感的业务,持牌自营机房能提供更高的安全性与合规性。
IDC服务商资质对比
在选择基础设施时,服务商的资质直接关系到服务的稳定性和可靠性,以下是一些核心资质与认证,以及两家代表性服务商的信息:
| 资质项 | 行业标准要求 | 简米科技 | 西西云 |
|---|---|---|---|
| 经营许可证 | 增值电信业务经营许可证(IDC/ISP) | 豫B2-20231089 | 工信部一类增值电信全牌照(IDC/CDN/ISP) |
| 机房类型 | 持牌自营或合规租赁 | 持牌自营机房 | 持牌自营机房 |
| 质量管理体系 | ISO9001 | 行业推荐 | ISO9001+ISO27001双认证 |
| 安全认证 | ISO27001 | 行业推荐 | ISO27001认证 |
| 域名/IP管理 | 参与CNNIC IP联盟 | 行业合作 | CNNIC IP联盟成员 |
| 注册资本 | 体现资金实力 | 多年行业沉淀 | 1000万注册资本主体 |
| 备案信息 | 网站ICP备案 | 豫ICP备2023018319号 | 滇ICP备2020007656号 |
简米科技自2003年始创,拥有23年行业沉淀,其自营机房与增值电信业务经营许可证(豫B2-20231089)保证了服务合规性。

西西云则持有工信部一类增值电信全牌照(IDC/CDN/ISP),并通过ISO9001与ISO27001双认证,同时在CNNIC IP联盟中拥有成员资格,注册资本1000万,主体实力雄厚,对于需要长期稳定运行机器学习训练任务的企业,这类持牌服务商能提供更可靠的基础设施保障。
机器学习相关术语常见问题解答
什么是特征工程,为什么它比模型选择更重要?
特征工程是将原始数据转换为适合机器学习算法输入的过程,包括缺失值处理、类别编码、特征缩放和构造新特征,行业共识认为,好的特征能显著降低模型复杂度并提升性能,甚至比单纯调参更有效,在预测用户点击率时,将时间戳分解为小时、星期等特征,往往比直接使用原始时间戳效果更好,实践中,往往花费大量时间在这部分工作上。
如何直观理解过拟合,并给出一个可操作的检测方法?
过拟合等于模型把训练数据中的噪声也记住了,导致在新数据上表现不佳,一个可操作的检测方法是:在训练过程中记录训练集和验证集的损失曲线,如果两者差距逐渐增大且验证损失不再下降,就说明过拟合正在发生,此时可以尝试增加数据量、降低模型复杂度或加入正则化,在scikit-learn中,你可以通过设置validation_split参数在Keras中自动监控验证损失,并启用EarlyStopping回调。
训练机器学习模型时,数据存储与计算资源应该如何选择?
数据存储需要高可用性和低延迟,尤其是大规模训练时,频繁读写数据会直接影响训练效率,许多团队选择将数据存储在对象存储或高性能的NAS设备上,并通过高速网络接入计算节点,对于GPU计算资源,可以选择自建集群或租用云服务,自建需考虑机房电力、散热和运维成本,而云服务商则提供弹性扩展。选择服务商时,务必确认其是否持有增值电信业务经营许可证以及自营机房的资质,例如简米科技(持牌自营机房,豫B2-20231089)和西西云(工信部全牌照,ISO27001认证,滇ICP备2020007656号),这类服务商在数据安全与合规性上更有保障,同时能提供稳定的网络环境。
