Эффективное создание нескольких масок из серии панд - PullRequest
0 голосов
/ 07 сентября 2018

Учитывая серию, которая выглядит как:

0    foo
1    bar
2    foo
3    foo
4    bar
5    baz

Как создать фрейм данных, в котором каждый столбец является маской для уникального значения в серии? В этом примере это будет выглядеть так:

    foo     bar     baz
0   True    False   False
1   False   True    False
2   True    False   False
3   True    False   False
4   False   True    False
5   False   False   True

Ответы [ 3 ]

0 голосов
/ 07 сентября 2018

Вот один с array-initialization -

def series_hotencode(s):
    a,b = s.factorize()
    ar = np.zeros((len(a),len(b)), dtype=bool)
    ar[np.arange(len(a)),a] = 1
    return pd.DataFrame(ar,columns=b)

Пробный прогон -

In [40]: s
Out[40]: 
0    foo
1    bar
2    foo
3    foo
4    bar
5    baz
Name: 1, dtype: object

In [41]: series_hotencode(s)
Out[41]: 
     foo    bar    baz
0   True  False  False
1  False   True  False
2   True  False  False
3   True  False  False
4  False   True  False
5  False  False   True
0 голосов
/ 07 сентября 2018

Давайте попробуем pd.factorize + np.eye для быстрого и краткого решения.

x,y = pd.factorize(s)
pd.DataFrame(np.eye(len(y), dtype=bool)[x], columns=y)

     foo    bar    baz
0   True  False  False
1  False   True  False
2   True  False  False
3   True  False  False
4  False   True  False
5  False  False   True
0 голосов
/ 07 сентября 2018

Использование get_dummies

s.str.get_dummies().astype(bool)
Out[392]: 
     bar    baz    foo
0  False  False   True
1   True  False  False
2  False  False   True
3  False  False   True
4   True  False  False
5  False   True  False

Или мы попробуем что-то новое crosstab

pd.crosstab(s.index,s).astype(bool)
Out[395]: 
a        bar    baz    foo
row_0                     
0      False  False   True
1       True  False  False
2      False  False   True
3      False  False   True
4       True  False  False
5      False   True  False
Добро пожаловать на сайт PullRequest, где вы можете задавать вопросы и получать ответы от других членов сообщества.
...