Мне нужно преобразовать несколько файлов CSV (с разными кодировками) в UTF-8.
Вот мой код:
#find encoding and if not in UTF-8 convert it
import os
import sys
import glob
import chardet
import codecs
myFiles = glob.glob('/mypath/*.csv')
csv_encoding = []
for file in myFiles:
with open(file, 'rb') as opened_file:
bytes_file=opened_file.read()
result=chardet.detect(bytes_file)
my_encoding=result['encoding']
csv_encoding.append(my_encoding)
print(csv_encoding)
for file in myFiles:
if csv_encoding in ['utf-8', 'ascii']:
print(file + ' in utf-8 encoding')
else:
with codecs.open(file, 'r') as file_for_conversion:
read_file_for_conversion = file_for_conversion.read()
with codecs.open(file, 'w', 'utf-8') as converted_file:
converted_file.write(read_file_for_conversion)
print(file +' converted to utf-8')
Когда я пытаюсь запустить этот код, я получаю следующая ошибка: UnicodeDecodeError: код 'utf-8' c не может декодировать байт 0xf3 в позиции 5057: недопустимый байт продолжения
Кто-нибудь может мне помочь? Спасибо !!!