У меня проблемы с извлечением узла из XML. xml_find_all не работает должным образом - PullRequest
1 голос
/ 09 ноября 2019

Мой вопрос может быть довольно простым, но у меня проблемы с работой с XML. У меня есть список метаболитов и база данных, где я могу найти информацию о них в формате XML. Я пытаюсь создать таблицу синонимов, чтобы я мог перевести названия метаболитов, которые у меня есть, к одному, более подходящему для последующего анализа. Вот простой код, где я пытаюсь получить доступ к узлу синонимов, и по какой-то причине не работает. Я попытался другой файл XML с успехом. Также будет полезен любой совет о том, как построить эту таблицу.

library(xml2)

metabolites <- read_xml('<?xml version="1.0" encoding="UTF-8"?>
                    <hmdb xmlns="http://www.hmdb.ca">
                    <metabolite>
                    <version>4.0</version>
                    <creation_date>2005-11-16 15:48:42 UTC</creation_date>
                    <update_date>2019-01-11 19:13:56 UTC</update_date>
                    <accession>HMDB0000001</accession>
                    <status>quantified</status>
                    <secondary_accessions>
                    <accession>HMDB00001</accession>
                    <accession>HMDB0004935</accession>
                    </secondary_accessions>
                    <name>1-Methylhistidine</name>
                    <cs_description>1-Methylhistidine, also known as 1-mhis...</cs_description>
                    <description>One-methylhistidine (1-MHis) is derived ...</description>
                    <synonyms>
                    <synonym>(2S)-2-amino-3-(1-Methyl-1H-imidazol-4-yl)propanoic acid</synonym>
                    <synonym>1-Methylhistidine</synonym>
                    <synonym>Pi-methylhistidine</synonym>
                    <synonym>(2S)-2-amino-3-(1-Methyl-1H-imidazol-4-yl)propanoate</synonym>
                    <synonym>1 Methylhistidine</synonym>
                    </synonyms>
                    <chemical_formula>C7H11N3O2</chemical_formula>
                    <average_molecular_weight>169.1811</average_molecular_weight>
                    </metabolite>
                    </hmdb>')


syn <- xml_find_all(metabolites, "//synonyms")

Спасибо!

1 Ответ

2 голосов
/ 09 ноября 2019

Это связано с объявлением пространства имен. См. Обсуждение здесь: https://github.com/r-lib/xml2/issues/222

library(xml2)

metabolites <- read_xml('<hmdb xmlns="http://www.hmdb.ca">
<metabolite>
<version>4.0</version>
<creation_date>2005-11-16 15:48:42 UTC</creation_date>
<update_date>2019-01-11 19:13:56 UTC</update_date>
<accession>HMDB0000001</accession>
<status>quantified</status>
<secondary_accessions>
<accession>HMDB00001</accession>
<accession>HMDB0004935</accession>
</secondary_accessions>
<name>1-Methylhistidine</name>
<cs_description>1-Methylhistidine, also known as 1-mhis...</cs_description>
<description>One-methylhistidine (1-MHis) is derived ...</description>
<synonyms>
<synonym>(2S)-2-amino-3-(1-Methyl-1H-imidazol-4-yl)propanoic acid</synonym>
<synonym>1-Methylhistidine</synonym>
<synonym>Pi-methylhistidine</synonym>
<synonym>(2S)-2-amino-3-(1-Methyl-1H-imidazol-4-yl)propanoate</synonym>
<synonym>1 Methylhistidine</synonym>
</synonyms>
<chemical_formula>C7H11N3O2</chemical_formula>
<average_molecular_weight>169.1811</average_molecular_weight>
</metabolite>
</hmdb>')

# namespace d1
xml_ns(metabolites)
#> d1 <-> http://www.hmdb.ca
#doesn't work
xml_find_all(metabolites, "//synonyms")
#> {xml_nodeset (0)}
#works
xml_find_all(metabolites, "//d1:synonyms")
#> {xml_nodeset (1)}
#> [1] <synonyms>\n  <synonym>(2S)-2-amino-3-(1-Methyl-1H-imidazol-4-yl)pro ...

Создано в 2019-11-09 пакетом Представить (v0.3.0)

...