Python中的主成分分析实例

王林原创: 2023-06-10 08:19:53126浏览

Python中的主成分分析实例

主成分分析（Principal Component Analysis，PCA）是一种常用于数据降维的方法，可以将高维度数据降维至低维度，保留尽可能多的数据变异信息。Python提供了许多用于实现PCA的库和工具，本文就通过一个实例来介绍如何使用Python中的sklearn库实现PCA。

首先，我们需要准备一个数据集。本文将使用Iris数据集，该数据集包含150条样本数据，每个样本都有4个特征值（花萼的长度和宽度、花瓣的长度和宽度），以及一个标签（鸢尾花的类型）。我们的目标是将这4个特征进行降维，找到最重要的主成分。

首先，我们需要导入必要的库和数据集。

from sklearn.datasets import load_iris
from sklearn.decomposition import PCA
import matplotlib.pyplot as plt

iris = load_iris()
X = iris.data
y = iris.target

现在我们可以创建一个PCA对象并应用它。

pca = PCA(n_components=2)
X_pca = pca.fit_transform(X)

这里的PCA对象设置n_components=2，表示我们只想在二维平面上展示我们处理后的数据。我们将fit_transform应用于原始数据X，获取处理后的数据集X_pca。

现在我们可以绘制结果图。

plt.scatter(X_pca[:, 0], X_pca[:, 1], c=y)
plt.xlabel('Component 1')
plt.ylabel('Component 2')
plt.show()

在这个图中，我们可以看到Iris数据集在降维后的二维空间中的分布。每个点都表示一个鸢尾花的样本，颜色表示鸢尾花的类型。

现在让我们看看主成分应该是什么。

print(pca.components_)

这会输出两个向量，分别称为“成分1”和“成分2”。

[[ 0.36158968 -0.08226889 0.85657211 0.35884393]
[-0.65653988 -0.72971237 0.1757674 0.07470647]]

每个元素表示原始数据中的一个特征的权重。换句话说，我们可以将主成分看作是用于线性组合原始特征的向量。结果中的每个向量都是一个单位向量。

我们也可以查看每个成分解释的数据方差量。

print(pca.explained_variance_ratio_)

这个输出会显示每个成分解释的数据方差量的比例。

[0.92461621 0.05301557]

我们可以看到，这两个成分总共解释了数据中94%的方差量。这意味着我们可以非常准确地捕捉数据的特征。

有一件事需要注意，PCA会将所有特征从原始数据中都删除。因此，如果我们需要保留某些特征，我们需要在应用PCA之前手动删除它们。

这就是如何使用Python中的sklearn库实现PCA的实例。PCA可应用于所有类型的数据，帮助我们从高维度数据中发现最重要的成分。如果您可以理解本文中的代码，你也就会有能力在您自己的数据集上应用PCA了。

以上就是Python中的主成分分析实例的详细内容，更多请关注php中文网其它相关文章！

数据分析 Python编程主成分分析 (PCA)PHP课程 HTML视频教程 CSS视频 JS视频教程 Vue视频教程

声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn核实处理。

上一条：Python中的分布式存储技巧下一条：Python入门学习路线详解

【24期】《PHP小白到大牛》线上班，开始报名了！

查看更多

相关课程

PHP直播课

Laravel 9 学习正当时—保姆级教程，想学不会都难！
61747次学习中级
千万级数据并发解决方案（理论+实战）
110327次学习高级
通用后台管理系统实战开发（Thinkphp6+Layui）
133038次学习中级
php开发验证码最新视频教程
31922次学习高级
PHP爬虫采集课程
13554次学习高级
微信小程序基础API篇
19069次学习高级

打开APP，随时随地在线学习！

Python中的主成分分析实例

相关文章

Laravel 9 学习正当时—保姆级教程，想学不会都难！

千万级数据并发解决方案（理论+实战）

通用后台管理系统实战开发（Thinkphp6+Layui）

php开发验证码最新视频教程

PHP爬虫采集课程

微信小程序基础API篇