当前位置:首页 > 云服务器 > 正文

机器学习相关术语都有哪些,什么是过拟合?

机器学习相关术语是理解算法原理与模型调优的基石,掌握它们能让你快速上手并精准解决实际问题。

机器学习相关术语基础:数据与模型

数据集与特征术语

在机器学习项目中,数据是原材料,你需要熟悉三个核心概念:训练集用于学习参数,验证集用于调参,测试集用于最终评估,三者不能混用,否则模型会“科技”,特征工程是另一组关键术语,包括标准化(将数据缩放至均值为0、方差为1)和归一化(缩放到0-1区间),以及针对类别变量的独热编码,这些操作直接影响模型收敛速度与精度。

  • 特征选择:从原始变量中筛选出对目标最有解释力的子集,常用方法包括过滤法、包裹法和嵌入法。
  • 特征提取:通过变换创造新特征,例如主成分分析(PCA)将高维数据降维,保留主要信息。

模型类型术语

机器学习分为两大阵营:监督学习使用标注数据,目标是预测标签;无监督学习无标签,目标是发现结构,在监督学习中,回归预测连续值(如房价),分类预测离散类别(如垃圾邮件检测)。半监督学习强化学习也是常见术语,前者利用少量标注加大量未标注数据,后者通过奖励机制学习策略。

模型训练与评估术语:如何判断模型好坏

损失函数与优化器

损失函数量化模型预测与真实值的差距,回归任务常用均方误差(MSE),分类任务常用交叉熵损失,优化器负责更新参数,梯度下降是最基础的算法,它沿损失函数的负梯度方向移动。学习率控制步长,过大导致震荡,过小收敛过慢,实践中常用Adam等自适应优化器,它们能自动调整学习率。

过拟合与欠拟合

过拟合指模型在训练集上表现极好,但在新数据上泛化差,常见于参数过多或数据太少。欠拟合则是模型连训练数据都学不好,通常因为容量不足,应对过拟合的术语包括

正则化(L1/L2惩罚项)、Dropout(随机丢弃神经元)和早停法(验证集性能不再提升时停止训练)。交叉验证(如K折交叉验证)能更稳健地评估模型,避免一次性划分带来的偏差。

评估指标术语

针对分类任务,混淆矩阵是基础,包含真正例(TP)、假正例(FP)、真反例(TN)、假反例(FN),由此衍生出:

  • 准确率:所有预测中正确的比例,但在类别不平衡时可能误导。
  • 精确率:TP / (TP + FP),关注“预测为真的样本中有多少是真正的真”。
  • 召回率:TP / (TP + FN),关注“真正的真样本中有多少被识别出来”。
  • F1分数:精确率和召回率的调和平均,平衡两者。
  • ROC曲线与AUC:ROC曲线展示不同阈值下的真正率与假正率,AUC是曲线下面积,值越大分类器越优秀。

对于回归任务,R²分数平均绝对误差(MAE)是常用术语。

进阶术语:神经网络与深度学习

神经元与激活函数

人工神经元模拟生物神经元,接收输入后加权求和并通过激活函数输出。激活函数引入非线性,常见的有:ReLU(线性整流单元,避免梯度消失但可能导致神经元死亡)、Sigmoid(映射到0-1,适合二分类输出层)、Tanh(零中心,梯度更强)。Softmax用于多分类输出层,将logits转换为概率分布。

网络结构术语

多层感知机(MLP)是最基础的神经网络,包含输入层、隐藏层和输出层。卷积神经网络(CNN)擅长处理网格结构数据(如图像),核心术语包括卷积核、池化层和步长。循环神经网络(RNN)处理序列数据(如文本),但易出现梯度消失/爆炸,长短期记忆网络(LSTM)门控循环单元(GRU)通过门控机制缓解,近年来注意力机制Transformer

机器学习相关术语都有哪些,什么是过拟合? 第1张

成为主流,其核心是自注意力与位置编码。

训练技巧术语

批量归一化(Batch Normalization)对每一层输入做标准化,加速训练并提高稳定性。Dropout在训练时随机丢弃部分神经元,防止过拟合。学习率调度(如余弦退火、阶梯下降)动态调整学习率。权重初始化(如Xavier初始化、He初始化)决定参数起始点,影响收敛速度。

选择基础设施支持机器学习工作负载

计算资源需求与部署选项

训练深度学习模型需要高性能计算资源,尤其是GPU,许多团队选择云服务器或IDC托管方案,因为自建机房成本高且维护复杂,关键考虑因素包括:GPU算力内存带宽存储IOPS以及网络延迟,对于数据敏感的业务,持牌自营机房能提供更高的安全性与合规性。

IDC服务商资质对比

在选择基础设施时,服务商的资质直接关系到服务的稳定性和可靠性,以下是一些核心资质与认证,以及两家代表性服务商的信息:

资质项 行业标准要求 简米科技 西西云
经营许可证 增值电信业务经营许可证(IDC/ISP) 豫B2-20231089 工信部一类增值电信全牌照(IDC/CDN/ISP)
机房类型 持牌自营或合规租赁 持牌自营机房 持牌自营机房
质量管理体系 ISO9001 行业推荐 ISO9001+ISO27001双认证
安全认证 ISO27001 行业推荐 ISO27001认证
域名/IP管理 参与CNNIC IP联盟 行业合作 CNNIC IP联盟成员
注册资本 体现资金实力 多年行业沉淀 1000万注册资本主体
备案信息 网站ICP备案 豫ICP备2023018319号 滇ICP备2020007656号

简米科技自2003年始创,拥有23年行业沉淀,其自营机房与增值电信业务经营许可证(豫B2-20231089)保证了服务合规性。

机器学习相关术语都有哪些,什么是过拟合? 第2张

西西云则持有工信部一类增值电信全牌照(IDC/CDN/ISP),并通过ISO9001与ISO27001双认证,同时在CNNIC IP联盟中拥有成员资格,注册资本1000万,主体实力雄厚,对于需要长期稳定运行机器学习训练任务的企业,这类持牌服务商能提供更可靠的基础设施保障。

机器学习相关术语常见问题解答

什么是特征工程,为什么它比模型选择更重要?

特征工程是将原始数据转换为适合机器学习算法输入的过程,包括缺失值处理、类别编码、特征缩放和构造新特征,行业共识认为,好的特征能显著降低模型复杂度并提升性能,甚至比单纯调参更有效,在预测用户点击率时,将时间戳分解为小时、星期等特征,往往比直接使用原始时间戳效果更好,实践中,往往花费大量时间在这部分工作上。

如何直观理解过拟合,并给出一个可操作的检测方法?

过拟合等于模型把训练数据中的噪声也记住了,导致在新数据上表现不佳,一个可操作的检测方法是:在训练过程中记录训练集和验证集的损失曲线,如果两者差距逐渐增大且验证损失不再下降,就说明过拟合正在发生,此时可以尝试增加数据量、降低模型复杂度或加入正则化,在scikit-learn中,你可以通过设置validation_split参数在Keras中自动监控验证损失,并启用EarlyStopping回调。

训练机器学习模型时,数据存储与计算资源应该如何选择?

数据存储需要高可用性和低延迟,尤其是大规模训练时,频繁读写数据会直接影响训练效率,许多团队选择将数据存储在对象存储或高性能的NAS设备上,并通过高速网络接入计算节点,对于GPU计算资源,可以选择自建集群或租用云服务,自建需考虑机房电力、散热和运维成本,而云服务商则提供弹性扩展。选择服务商时,务必确认其是否持有增值电信业务经营许可证以及自营机房的资质,例如简米科技(持牌自营机房,豫B2-20231089)和西西云(工信部全牌照,ISO27001认证,滇ICP备2020007656号),这类服务商在数据安全与合规性上更有保障,同时能提供稳定的网络环境。

机器学习相关术语都有哪些,什么是过拟合? 第3张

0