В предыдущем посте я получил помощь в изменении одной переменной на основе условий, наложенных на несколько других переменных.
Однако возникло еще одно осложнение, поскольку у меня есть несколько пропущенных значений в переменных группировки.Ниже приведен пример кадра данных:
df2 <- data.frame(
ID = c(101:110),
Name = c("AA", "BB", "AA", "DD", "EE", "FF", "AA", "GG", "DD", "HH"),
Age = c(1, 56, 1, 72, 12, 43, 1, 32, 72, 99),
Gender = c("F", "M", "F", NA , NA, "M", "F", "M", NA, "M"),
Group = c(1, 2, 1, 2, 1, 4, 1, 3, 2, 4),
Date = seq(from = as.Date("2019-01-01"), to = as.Date("2019-01-10"), by = 'day'),
Order = c("re-do", "first", "first", "first", "re-do", "first", "re-do", "first", "re-do", "first"),
Site = c(2, 54, 2, 522, 3, 490, 2, 23, 522, 21)
)
>df2
ID Name Age Gender Group Date Order Site
1 101 AA 1 F 1 2019-01-01 re-do 2
2 102 BB 56 M 2 2019-01-02 first 54
3 103 AA 1 F 1 2019-01-03 first 2
4 104 DD 72 <NA> 2 2019-01-04 first 522
5 105 EE 12 <NA> 1 2019-01-05 re-do 3
6 106 FF 43 M 4 2019-01-06 first 490
7 107 AA 1 F 1 2019-01-07 re-do 2
8 108 GG 32 M 3 2019-01-08 first 23
9 109 DD 72 <NA> 2 2019-01-09 re-do 522
10 110 HH 99 M 4 2019-01-10 first 21
У меня есть функция, которая группирует по имени, возрасту, полу и группе, а затем изменяет идентификатор в зависимости от столбцов даты и порядка:
library(dplyr)
df2 %>%
group_by(Name, Age, Gender, Group, Site) %>%
mutate(first_date = ifelse(Order == "first",
Date,
Date[Order == "first"])) %>%
mutate(ID = ifelse(n() > 1 & Date >= first_date,
ID[Order == "first"],
ID)) %>%
select(-first_date)
Однако проблема, с которой я столкнулся, заключается в том, что значения NA по-прежнему сопоставляются и используются (см. Значение идентификатора, скопированное в строках 4 и 9 ниже):
ID Name Age Gender Group Date Order Site
<int> <fct> <dbl> <fct> <dbl> <date> <fct> <dbl>
1 101 AA 1 F 1 2019-01-01 re-do 2
2 102 BB 56 M 2 2019-01-02 first 54
3 103 AA 1 F 1 2019-01-03 first 2
4 104 DD 72 NA 2 2019-01-04 first 522
5 105 EE 12 NA 1 2019-01-05 re-do 3
6 106 FF 43 M 4 2019-01-06 first 490
7 103 AA 1 F 1 2019-01-07 re-do 2
8 108 GG 32 M 3 2019-01-08 first 23
9 104 DD 72 NA 2 2019-01-09 re-do 522
10 110 HH 99 M 4 2019-01-10 first 21
Warning messages:
1: Factor `Gender` contains implicit NA, consider using `forcats::fct_explicit_na`
2: Factor `Gender` contains implicit NA, consider using `forcats::fct_explicit_na`
3: Factor `Gender` contains implicit NA, consider using `forcats::fct_explicit_na`
4: Factor `Gender` contains implicit NA, consider using `forcats::fct_explicit_na`
То, что я хотел бы получитьто, что строки с NA игнорируются, но не удаляются (это единственный результат, который мне удалось получить, используя na_omit()
внутри канала), так что это выглядит так:
ID Name Age Gender Group Date Order Site
1 101 AA 1 F 1 2019-01-01 re-do 2
2 102 BB 56 M 2 2019-01-02 first 54
3 103 AA 1 F 1 2019-01-03 first 2
4 104 DD 72 <NA> 2 2019-01-04 first 522
5 105 EE 12 <NA> 1 2019-01-05 re-do 3
6 106 FF 43 M 4 2019-01-06 first 490
7 103 AA 1 F 1 2019-01-07 re-do 2
8 108 GG 32 M 3 2019-01-08 first 23
9 109 DD 72 <NA> 2 2019-01-09 re-do 522
10 110 HH 99 M 4 2019-01-10 first 21