У меня есть следующий файл XML, который я должен проанализировать и извлечь из него данные в CSV-файле. В этом файле у меня есть два блока (box_id), которые упакованы в два разных родительских объекта (parent_box_id), а также есть детали содержимого каждого из блоков (элемент sgtin -> info_sgtin).
<?xml version="1.0" encoding="UTF-8" standalone="yes"?>
<doc>
<info id_reference="2">
<data_down>
<tree>
<box_id>046071598600870568</box_id>
<parent_box_id>046071598600875594</parent_box_id>
</tree>
<tree>
<box_id>046071598600870575</box_id>
<parent_box_id>046071598600875595</parent_box_id>
</tree>
<tree>
<sgtin>
<info_sgtin>
<sgtin>04607008133585B0SE1HVHBGR3A</sgtin>
<box_id>046071598600870568</box_id>
<gtin>04607008133585</gtin>
<series_number>026A</series_number>
</info_sgtin>
</sgtin>
<parent_box_id>046071598600870568</parent_box_id>
</tree>
<tree>
<sgtin>
<info_sgtin>
<sgtin>046070081335856F7P78HBVBEH2</sgtin>
<box_id>046071598600870568</box_id>
<gtin>04607008133585</gtin>
<series_number>026A</series_number>
</info_sgtin>
</sgtin>
<parent_box_id>046071598600870568</parent_box_id>
</tree>
<tree>
<sgtin>
<info_sgtin>
<sgtin>046070081335854T61H7CSXDE9W</sgtin>
<box_id>046071598600870575</box_id>
<gtin>04607008133585</gtin>
<series_number>026A</series_number>
</info_sgtin>
</sgtin>
<parent_box_id>046071598600870575</parent_box_id>
</tree>
</data_down>
</info>
</doc>
Для этой цели я решил использовать Elementtree в Python, но проблема в том, что в моем файле XML есть два варианта тега.
Прежде всего я перебираю все детали и захватить значение box_id, но после этого мне нужно go к родительскому элементу и получить parent_box_id, в который упакован этот box_id.
Другими словами, я хочу получить данные следующим образом:
parent_box_id box_id sgtin series_number
046071598600875594 046071598600870568 04607008133585B0SE1HVHBGR3A 026A
046071598600875594 046071598600870568 046070081335856F7P78HBVBEH2 026A
046071598600875595 046071598600870575 046070081335854T61H7CSXDE9W 026A
Но я не могу понять, как получить значение parent_box_id. Буду признателен за любую поддержку со стороны сообщества.
Вот код, который у меня есть:
import csv
import xml.etree.ElementTree as ET
csv.writer(open('result.csv','w'),delimiter=';', quotechar='"', quoting=csv.QUOTE_MINIMAL))
tree = ET.parse('test.xml')
root = tree.getroot()
with open('result.csv','a',newline='') as myfile:
writer = csv.writer(myfile, delimiter=';', quotechar='"', quoting=csv.QUOTE_MINIMAL)
for alist in root.iter('info_sgtin'):
sgtin = alist.find('sgtin').text
box_id = alist.find('box_id').text
series = alist.find('series_number').text
writer.writerow([sgtin,box_id,series])