Функция R для условия на основе нескольких столбцов в dplyr - PullRequest
1 голос
/ 20 марта 2020

У меня есть набор идентификаторов патентов с датой записи и статусом заболевания. Я хочу удалить строки после 1 случая возникновения заболевания и сохранить минимальную дату записи, когда пациент никогда не болел (т. Е. Болезнь = 0 во всех строках для идентификатора пациента). ). Мой набор данных выглядит как

ID    Date    Disease
123 02-03-2012  0
123 03-03-2013  1
123 04-03-2014  0
321 03-03-2015  1
423 06-06-2016  1
423 07-06-2017  1
543 08-05-2018  1
543 09-06-2019  0
645 08-09-2019  0
645 10-10-2018  0
645 11-10 -2012 0 

и вывод, который я хочу

ID     Date       Disease
123  02-03-2012    0
123  03-03-2013    1
321  03-03-2015    1
423  06-06-2016    1
543  08-05-2018    1
645  11-10 -2012   0

Ответы [ 2 ]

0 голосов
/ 20 марта 2020

Мы также можем использовать slice

library(dplyr)
library(lubridate)
df1 %>% 
   arrange(ID, dmy(Date)) %>%
   group_by(ID) %>%
   slice(seq_len(which.max(Disease)))
# A tibble: 6 x 3
# Groups:   ID [5]
#     ID Date       Disease
#  <int> <chr>        <int>
#1   123 02-03-2012       0
#2   123 03-03-2013       1
#3   321 03-03-2015       1
#4   423 06-06-2016       1
#5   543 08-05-2018       1
#6   645 11-10-2012       0
0 голосов
/ 20 марта 2020

Мы можем преобразовать Dates, group_by ID и выбирать строки до 1-го появления 1 или минимального значения.

library(dplyr)

df %>%
  mutate(Date = as.Date(Date, "%d-%m-%Y")) %>%
  arrange(ID, Date) %>%
  group_by(ID) %>%
  filter(row_number() <= which.max(Disease == 1))

#     ID Date       Disease
#  <int> <date>       <int>
#1   123 2012-03-02       0
#2   123 2013-03-03       1
#3   321 2015-03-03       1
#4   423 2016-06-06       1
#5   543 2018-05-08       1
#6   645 2012-10-11       0
Добро пожаловать на сайт PullRequest, где вы можете задавать вопросы и получать ответы от других членов сообщества.
...