Итак, у меня есть два столбца значений и два весовых столбца в фрейме данных Pandas, и я хочу создать третий столбец, который будет сгруппирован по средневзвешенному значению этих двух столбцов.
Так для:
df = pd.DataFrame({'category':['a','a','b','b'],
'var1':np.random.randint(0,100,4),
'var2':np.random.randint(0,100,4),
'weights1':np.random.random(4),
'weights2':np.random.random(4)})
df
category var1 var2 weights1 weights2
0 a 84 45 0.955234 0.729862
1 a 49 5 0.225470 0.159662
2 b 77 95 0.957212 0.991960
3 b 27 65 0.491877 0.195680
Я бы хотел выполнить:
df
category var1 var2 weights1 weights2 average
0 a 84 45 0.955234 0.729862 67.108023
1 a 49 5 0.225470 0.159662 30.759124
2 b 77 95 0.957212 0.991960 86.160443
3 b 27 65 0.491877 0.195680 37.814851
Я уже выполнил это, используя только такие арифметические операторы:
df['average'] = df.groupby('category', group_keys=False) \
.apply(lambda g: (g.weights1 * g.var1 + g.weights2 * g.var2) / (g.weights1 + g.weights2))
Но я хочу обобщить его, используя numpy.average, поэтому я могу, например, взять средневзвешенное значение из 3 или более столбцов.
Я пытаюсь что-то вроде этого, но, похоже, это не работает:
df['average'] = df.groupby('category', group_keys=False) \
.apply(lambda g: np.average([g.var1, g.var2], axis=0, weights=[g.weights1, g.weights2]))
возвращение
TypeError: incompatible index of inserted column with frame index
Может кто-нибудь помочь мне сделать это?