Python随机森林算法详解与案例实现

随机森林（Random Forest）是一种基于决策树的集成学习算法，由多个决策树组成的「森林」构成。它通过Bagging（自助法采样）和特征随机选择来提高模型的泛化能力，减少过拟合的可能性。该算法通常在分类问题和回归问题上都能取得良好效果。使用Iris数据集（鸢尾花数据集），其中包含150条记录，每条记录有4个特征，目标是根据花萼和花瓣的尺寸预测其品种（Setosa, Versicolor, V

闲人编程

2762人浏览 · 2024-10-15 07:30:00

闲人编程 · 2024-10-15 07:30:00 发布

Python随机森林算法详解与案例实现

1、随机森林算法概述

随机森林（Random Forest） 是一种基于决策树的集成学习算法，由多个决策树组成的「森林」构成。它通过Bagging（自助法采样）和特征随机选择来提高模型的泛化能力，减少过拟合的可能性。该算法通常在分类问题和回归问题上都能取得良好效果。

2、随机森林的原理

Bagging（自助法采样）：
在训练过程中，从数据集中有放回地抽取若干样本构建不同的决策树。每棵树只对一部分数据进行训练，使得模型更加稳健。
特征随机选择：
在每棵树的构建过程中，不是使用全部特征，而是随机选择一部分特征用于分裂节点，这进一步增强了模型的多样性。
多数投票和平均：
- 对于分类问题：多个树的预测结果通过投票决定最终类别。
- 对于回归问题：将所有树的输出值取平均，作为最终预测值。

3、实现步骤

我们将用Python实现一个随机森林算法解决两个典型问题：分类和回归。代码将采用面向对象的编程思想（OOP），通过类封装模型逻辑。

4、分类案例：使用随机森林预测鸢尾花品种

4.1 数据集介绍

使用Iris数据集（鸢尾花数据集），其中包含150条记录，每条记录有4个特征，目标是根据花萼和花瓣的尺寸预测其品种（Setosa, Versicolor, Virginica）。

4.2 代码实现

import numpy as np
from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split
from sklearn.metrics import accuracy_score
from sklearn.ensemble import RandomForestClassifier

class IrisRandomForest:
    def __init__(self, n_estimators=100, max_depth=None, random_state=42):
        """初始化随机森林分类器"""
        self.n_estimators = n_estimators
        self.max_depth = max_depth
        self.random_state = random_state
        self.model = RandomForestClassifier(
            n_estimators=self.n_estimators, 
            max_depth=self.max_depth, 
            random_state=self.random_state
        )

    def load_data(self):
        """加载Iris数据集并拆分为训练集和测试集"""
        iris = load_iris()
        X_train, X_test, y_train, y_test = train_test_split(
            iris.data, iris.target, test_size=0.3, random_state=self.random_state
        )
        return X_train, X_test, y_train, y_test

    def train(self, X_train, y_train):
        """训练模型"""
        self.model.fit(X_train, y_train)

    def evaluate(self, X_test, y_test):
        """评估模型性能"""
        predictions = self.model.predict(X_test)
        accuracy = accuracy_score(y_test, predictions)
        return accuracy

if __name__ == "__main__":
    rf_classifier = IrisRandomForest(n_estimators=100, max_depth=5)
    X_train, X_test, y_train, y_test = rf_classifier.load_data()
    rf_classifier.train(X_train, y_train)
    accuracy = rf_classifier.evaluate(X_test, y_test)
    print(f"分类模型的准确率: {accuracy:.2f}")

4.3 代码解释

IrisRandomForest 类 封装了模型的初始化、数据加载、模型训练和评估流程。
使用Scikit-learn库中的RandomForestClassifier来构建模型。
数据集通过train_test_split拆分为训练集和测试集，测试集占30%。
模型最终打印出分类准确率。

4.4 运行结果

分类模型的准确率通常在95%以上，证明随机森林对鸢尾花数据的分类性能非常优秀。

5、回归案例：使用随机森林预测波士顿房价

5.1 数据集介绍

我们使用波士顿房价数据集，其中每条记录包含影响房价的多个特征。目标是根据这些特征预测房价。

5.2 代码实现

from sklearn.datasets import fetch_california_housing
from sklearn.ensemble import RandomForestRegressor
from sklearn.metrics import mean_squared_error

class HousingPricePredictor:
    def __init__(self, n_estimators=100, max_depth=None, random_state=42):
        """初始化随机森林回归模型"""
        self.n_estimators = n_estimators
        self.max_depth = max_depth
        self.random_state = random_state
        self.model = RandomForestRegressor(
            n_estimators=self.n_estimators, 
            max_depth=self.max_depth, 
            random_state=self.random_state
        )

    def load_data(self):
        """加载房价数据并拆分为训练集和测试集"""
        data = fetch_california_housing()
        X_train, X_test, y_train, y_test = train_test_split(
            data.data, data.target, test_size=0.3, random_state=self.random_state
        )
        return X_train, X_test, y_train, y_test

    def train(self, X_train, y_train):
        """训练模型"""
        self.model.fit(X_train, y_train)

    def evaluate(self, X_test, y_test):
        """评估模型性能"""
        predictions = self.model.predict(X_test)
        mse = mean_squared_error(y_test, predictions)
        return mse

if __name__ == "__main__":
    predictor = HousingPricePredictor(n_estimators=100, max_depth=10)
    X_train, X_test, y_train, y_test = predictor.load_data()
    predictor.train(X_train, y_train)
    mse = predictor.evaluate(X_test, y_test)
    print(f"回归模型的均方误差: {mse:.2f}")