Я запускаю следующий скрипт:
import numpy as np
import matplotlib.pyplot as plt
import pandas as pd
from sklearn.preprocessing import OneHotEncoder
dataset = pd.read_csv('data/50_Startups.csv')
X = dataset.iloc[:, :-1].values
y = dataset.iloc[:, 4].values
onehotencoder = OneHotEncoder(categorical_features=3,
handle_unknown='ignore')
onehotencoder.fit(X)
Заголовок данных выглядит так: data
И у меня есть это:
ValueError: не удалось преобразовать строку в число с плавающей точкой: 'New York'
Я прочитал ответы на похожих вопросов, а затем открыл scikit-learn документации, но, как вы можете видеть, у авторов scikit-learn нет проблем с пробелами в строках
Я знаю, что могу использовать LabelEncocder
из sklearn.preprocessing
, а затем использовать OHE, и это работает хорошо,но в этом случае
In case you used a LabelEncoder before this OneHotEncoder to convert the categories to integers, then you can now use the OneHotEncoder directly.
warnings.warn(msg, FutureWarning)
происходит массаж.
Вы можете использовать полный CSV-файл или
[[165349.2, 136897.8, 471784.1, 'New York', 192261.83],
[162597.7, 151377.59, 443898.53, 'California', 191792.06],
[153441.51, 101145.55, 407934.54, 'Florida', 191050.39],
[144372.41, 118671.85, 383199.62, 'New York', 182901.99],
[142107.34, 91391.77, 366168.42, 'Florida', 166187.94]]
5 первых строк, чтобы проверить этокод.