Question

Я получил эту ошибку при использовании этого кода, чтобы удалить вложенный столбец с pyspark. Почему это не работает? Я пытался использовать тильду вместо not! =, Как предполагает ошибка, но она тоже не работает. Так что вы делаете в этом случае?

def drop_col(df, struct_nm, delete_struct_child_col_nm):
    fields_to_keep = filter(lambda x:  x != delete_struct_child_col_nm, df.select(" 
{}.*".format(struct_nm)).columns)
    fields_to_keep = list(map(lambda x:  "{}.{}".format(struct_nm, x), fields_to_keep))
    return df.withColumn(struct_nm, struct(fields_to_keep))

danielcahall · Answer 1 · 10 апреля 2020

Я построил простой пример со столбцом структуры и несколькими фиктивными столбцами:

from pyspark import SQLContext
from pyspark.sql import SparkSession
from pyspark.sql.functions import monotonically_increasing_id, lit, col, struct
from pyspark.sql.types import StructType, StructField, StringType, IntegerType

spark = SparkSession.builder.getOrCreate()
sql_context = SQLContext(spark.sparkContext)
schema = StructType(
    [
        StructField('addresses',
                    StructType(
                        [StructField("state", StringType(), True),
                         StructField("street", StringType(), True),
                        StructField("country", StringType(), True),
                         StructField("code", IntegerType(), True)]
                    )
                    )
    ]
)

rdd = [({'state': 'pa', 'street': 'market', 'country': 'USA', 'code': 100},),
       ({'state': 'ca', 'street': 'baker',  'country': 'USA', 'code': 101},)]

df = sql_context.createDataFrame(rdd, schema)
df = df.withColumn('id', monotonically_increasing_id())
df = df.withColumn('name', lit('test'))

print(df.show())
print(df.printSchema())

Вывод:

+--------------------+-----------+----+
|           addresses|         id|name|
+--------------------+-----------+----+
|[pa, market, USA,...| 8589934592|test|
|[ca, baker, USA, ...|25769803776|test|
+--------------------+-----------+----+

root
 |-- addresses: struct (nullable = true)
 |    |-- state: string (nullable = true)
 |    |-- street: string (nullable = true)
 |    |-- country: string (nullable = true)
 |    |-- code: integer (nullable = true)
 |-- id: long (nullable = false)
 |-- name: string (nullable = false)

Чтобы удалить весь столбец структуры, вы можете просто использовать drop function:

df2 = df.drop('addresses')
print(df2.show())

Вывод:

+-----------+----+
|         id|name|
+-----------+----+
| 8589934592|test|
|25769803776|test|
+-----------+----+

Чтобы удалить указанные c поля, в столбце структуры это немного сложнее - есть и другие подобные вопросы здесь:

В любом случае я нахожу их немного сложными - мой подход заключается в том, чтобы просто переназначить исходный столбец с подмножеством структурных полей, которые вы хотите сохранить:

columns_to_keep = ['country', 'code']

df = df.withColumn('addresses', struct(*[f"addresses.{column}" for column in columns_to_keep]))

Вывод:

+----------+-----------+----+
| addresses|         id|name|
+----------+-----------+----+
|[USA, 100]| 8589934592|test|
|[USA, 101]|25769803776|test|
+----------+-----------+----+

В качестве альтернативы, если вы просто хотите указать столбцы, которые хотите удалить, а не столбцы, которые хотите сохранить:

columns_to_remove = ['country', 'code']
all_columns = df.select("addresses.*").columns
columns_to_keep = list(set(all_columns) - set(columns_to_remove))
df = df.withColumn('addresses', struct(*[f"addresses.{column}" for column in columns_to_keep]))

Вывод:

+------------+-----------+----+
|   addresses|         id|name|
+------------+-----------+----+
|[pa, market]| 8589934592|test|
| [ca, baker]|25769803776|test|
+------------+-----------+----+

Надеюсь это помогает!

ValueError: Невозможно преобразовать столбец в bool: используйте '&' for 'и', '|' для 'or', '~' для 'not' при построении логических выражений DataFrame

Пожалуйста, войдите или зарегистрируйтесь чтобы ответить на этот вопрос.

1 Ответ

Пожалуйста, войдите или зарегистрируйтесь что бы добавить комментарий.

ValueError: Невозможно преобразовать столбец в bool: используйте '&' for 'и', '|' для 'or', '~' для 'not' при построении логических выражений DataFrame

Пожалуйста, войдите или зарегистрируйтесь чтобы ответить на этот вопрос.

1 Ответ

Пожалуйста, войдите или зарегистрируйтесь что бы добавить комментарий.

Похожие темы