Условное заполнение строк NA со сравнением строк, не помеченных NA - PullRequest
0 голосов
/ 24 апреля 2019

Я хочу заполнить строки NA, основываясь на проверке различий между ближайшими строками без меток.

Например

data <- data.frame(sd_value=c(34,33,34,37,36,45),  
                   value=c(383,428,437,455,508,509),                   
                   label=c(c("bad",rep(NA,4),"unable")))

> data
  sd_value value  label
1       34   383    bad
2       33   428   <NA>
3       34   437   <NA>
4       37   455   <NA>
5       36   508   <NA>
6       45   509 unable

Я хочу оценить, как изменить NA строк, проверив разницу между sd_value и value теми, которые близки к bad и unable строкам.

если мы хотим получить различия между строками, которые мы можем сделать;

library(dplyr)
data%>%
mutate(diff_val=c(0,diff(value)), diff_sd_val=c(0,diff(sd_value)))

  sd_value value  label diff_val diff_sd_val
1       34   383    bad        0           0
2       33   428   <NA>       45          -1
3       34   437   <NA>        9           1
4       37   455   <NA>       18           3
5       36   508   <NA>       53          -1
6       45   509 unable        1           9

Условие, которым я хочу пометить строки NA:

, если diff_val<50 и diff_sd_val<9 помечают их последней меткой non-NA, иначе используют первую метку non-NA после последней строки NA.

Так что ожидаемый результат будет

sd_value value  label diff_val diff_sd_val
    1       34   383    bad        0           0
    2       33   428    bad       45          -1
    3       34   437    bad        9           1
    4       37   455    bad       18           3
    5       36   508 unable    53          -1
    6       45   509 unable        1           9

Возможное решение, которое я уже приготовил:

custom_labelling <- function(x,y,label){

    diff_sd_val<-c(NA,diff(x))

    diff_val<-c(NA,diff(y))
    label <- NA
    for (i in 1:length(label)){

      if(is.na(label[i])&diff_sd_val<9&diff_val<50){

      label[i] <- label
      }
      else {

        label <- label[i]
      }
    }
    return(label)
  }

что дает

data%>%
  mutate(diff_val=c(0,diff(value)), diff_sd_val=c(0,diff(sd_value)))%>%
  mutate(custom_label=custom_labelling(sd_value,value,label))

Ошибка в mutate_impl (.data, точки): Ошибка оценки: пропущено значение, где требуется ИСТИНА / ЛОЖЬ. Дополнительно: предупреждающее сообщение: В if (is.na (label [i]) & diff_sd_val <9 & diff_val <50) {: условие имеет длину> 1, и будет использоваться только первый элемент

1 Ответ

1 голос
/ 24 апреля 2019

Один из вариантов - найти NA и индекс не-NA и на основе условия выбрать ближайший к нему ярлык.

library(dplyr)

#Create a new dataframe with diff_val and diff_sd_val
data1 <- data%>% mutate(diff_val=c(0,diff(value)), diff_sd_val=c(0,diff(sd_value)))

#Get the NA indices
NA_inds <- which(is.na(data1$label))
#Get the non-NA indices
non_NA_inds <- setdiff(1:nrow(data1), NA_inds)

#For every NA index
for (i in NA_inds) {
   #Check the condition
   if(data1$diff_sd_val[i] < 9 & data1$diff_val[i] < 50) 
     #Get the last non-NA label
     data1$label[i] <- data1$label[non_NA_inds[which.max(i > non_NA_inds)]]
   else
     #Get the first non-NA label after last NA value
     data1$label[i] <- data1$label[non_NA_inds[i < non_NA_inds]]
}


data1
#  sd_value value  label diff_val diff_sd_val
#1       34   383    bad        0           0
#2       33   428    bad       45          -1
#3       34   437    bad        9           1
#4       37   455    bad       18           3
#5       36   508 unable       53          -1
#6       45   509 unable        1           9

Вы можете удалить столбцы diff_val и diff_sd_val позже, если они не нужны.


Мы также можем создать функцию

custom_label <- function(label, diff_val, diff_sd_val) {
   NA_inds <- which(is.na(label))
   non_NA_inds <- setdiff(1:length(label), NA_inds)
   new_label = label

   for (i in NA_inds) {
     if(diff_sd_val[i] < 9 & diff_val[i] < 50) 
       new_label[i] <- label[non_NA_inds[which.max(i > non_NA_inds)]]
     else
       new_label[i] <- label[non_NA_inds[i < non_NA_inds]]
   }
  return(new_label)
 }

, а затем применить его

data%>% 
  mutate(diff_val = c(0, diff(value)), 
         diff_sd_val = c(0, diff(sd_value)), 
         new_label = custom_label(label, diff_val, diff_sd_val))


#  sd_value value  label diff_val diff_sd_val new_label
#1       34   383    bad        0           0       bad
#2       33   428   <NA>       45          -1       bad
#3       34   437   <NA>        9           1       bad
#4       37   455   <NA>       18           3       bad
#5       36   508   <NA>       53          -1    unable
#6       45   509 unable        1           9    unable

Если мы хотим применить его по группам, мы можем добавить оператор group_by, и он должен работать.

data%>% 
   group_by(group) %>%
   mutate(diff_val = c(0, diff(value)), 
          diff_sd_val = c(0, diff(sd_value)), 
          new_label = custom_label(label, diff_val, diff_sd_val))
...