Изменить порядок только часть панды DataFrame - PullRequest
2 голосов
/ 29 мая 2019

Контекст

У меня есть pandas-DataFrame со структурой, аналогичной таблице слева:

      + Category + Content + Layer                + Category + Content + Layer
Index |          |         |                Index |          |         |      
----------------------------------          ----------------------------------  
000001|   "A"    | "Dummy" |  0         ->  000001|   "A"    | "Dummy" |  0   
----------------------------------          ----------------------------------
000002|   "A"    | "Dummy" |  1         ->  000003|   "A"    | "Dummy" |  0   
----------------------------------          ----------------------------------
000003|   "A"    | "Dummy" |  0         ->  000002|   "A"    | "Dummy" |  1   
----------------------------------          ----------------------------------
000004|   "A"    | "Dummy" |  1         ->  000004|   "A"    | "Dummy" |  1    
----------------------------------          ----------------------------------
000005|   "B"    | "Dummy" |  2         =   000005|   "B"    | "Dummy" |  2   
----------------------------------          ----------------------------------
000006|   "B"    | "Dummy" |  0         =   000006|   "B"    | "Dummy" |  0   
----------------------------------          ----------------------------------
000007|   "B"    | "Dummy" |  4         =   000007|   "B"    | "Dummy" |  4   
----------------------------------          ----------------------------------

Чего я хочу добиться, так этоизменить порядок данных, как показано справа.

Вопрос

Как показано в правой таблице, предполагается переупорядочить только часть кадра данных - Только элементыcategory == "A" заказывается в порядке возрастания их layer.Все элементы category == "B" должны оставаться такими, как есть (что является моей текущей проблемой при работе с dataframe.sort_values() и т. Д.).

Как я могу переупорядочить (применить) только указанныйчасть кадра данных без влияния на остальные?

1 Ответ

4 голосов
/ 29 мая 2019

Это можно сделать в два этапа:

  1. Фильтрация строк по условию, например, путем создания логического значения mask
  2. Прямая адресация базовых массивов с помощью .loc (чтобы предотвратить выравнивание значений индекса)

.loc: доступ к группе строк и столбцов по меткам или булевому массиву.( Ссылка на pandas-Documentation )

    #Boolean mask of the entire dataframe in order to identify relevant rows
    mask = df['Category'].eq('A')     #Anlog to mask = (df["Category"] == 'A')

    #pandas >= 0.24
    df.loc[mask] = df.loc[mask].sort_values('Layer').to_numpy()

    #pandas < 0.24
    df.loc[mask] = df.loc[mmask.sort_values('Layer').values

    #Result
    print (df)
           Category Content  Layer
    Index                         
    000001        A   Dummy      0
    000002        A   Dummy      0
    000003        A   Dummy      1
    000004        A   Dummy      1
    000005        B   Dummy      2
    000006        B   Dummy      0
    000007        B   Dummy      4
Добро пожаловать на сайт PullRequest, где вы можете задавать вопросы и получать ответы от других членов сообщества.
...