Использование php для разбора HTML-документа - PullRequest
0 голосов
/ 02 марта 2011

Я создаю php-приложение для разбора содержимого HTML. Мне нужно хранить определенный столбец таблицы в переменных php.

Вот мой код:

$dom = new domDocument;

@$dom->loadHTML($html);
$dom->preserveWhiteSpace = false;
$tables = $dom->getElementsByTagName('table');

    $rows = $tables->item(0)->getElementsByTagName('tr');    
    $flag=0;
    foreach ($rows as $row)
    {
            if($flag==0) $flag=1;
            else
            {
                    $cols = $row->getElementsByTagName('td');
                    foreach ($cols as $col)
                    {
                        echo $col->nodeValue; //NEED HELP HERE
                    }
                    echo '<hr />';
            }
     }

В каждом ряду первый столбец - КЛЮЧ, второй - ЗНАЧЕНИЕ. Как создать пары ключ-значение из таблицы и сохранить их как массивы в php.

Я пробовал много вещей, но каждый раз я просто получаю DOMElement Object() в качестве значения.

Любая помощь высоко ценится ...

HTML по запросу:

<table align='center' border='0' cellpadding='0' cellspacing='0' style='border-collapse: collapse' width='780' height=100%>
<tr><td height=96% align=center><BR><BR>    
<html>
<head>
</head>
<body style="background:url(uptu_logo1.gif); background-repeat:no-repeat; background-position:center">
<p align="center" style="font-size:18px"><span style='font-size:20px'>this text is unimportant gibberish that is not required by my app</span><br/><span style='font-size:16px'>this text is unimportant gibberish that is not required by my app</span><br/><u>B.Tech. Third Year Result 2009-10. this text is unimportant gibberish that is not required by my app</u></p>
<br/>
<table align="center" border="1" cellpadding="0" cellspacing="0" bordercolor="#E3DDD5" width="700" style="border-collapse: collapse; font-size: 11px">
<tr>

<td width="50%"><b>Name:</b></td>
<td width="50%">John Fernandes          </td>
</tr>
<tr>
<td><b>Fathers Name:</b></td>
<td>Caith Fernandes                 </td>
</tr>
<tr>
<td><b>Roll No:</b></td>
<td>0702410099</td>
</tr>

<tr>
<td><b>Status:</b></td>
<td>REGULAR   </td>
</tr>
<tr>
<td><b>Course/Branch:</b></td>
<td>B. Tech. </td>
</tr>
<tr>
<td><b>Institute Name</b></td>
<td>Imperial College of Science and Technology</td>

</tr>
</table>

Мой код PHP выводит:

Name:John Fernandes          <hr />
Fathers Name:Caith Fernandes                 <hr />
Roll No:0702410099<hr />
Status:REGULAR   <hr />
Course/Branch:B. Tech. Computer Science and Engineering (10)<hr />
Imperial College of Science and Technology<hr />

Также, как избавиться от этого глупого? Я видел в оригинальном HTML, поэтому я попытался очистить с помощью функции PHP html_entity_decode() Но он все еще там ...

1 Ответ

2 голосов
/ 02 марта 2011

Какой HTML-код вы загружаете?Я предполагаю, что это что-то простое, например, так:

<table>
    <tr>
        <td>heading</td>
        <td>heading</td>
    </tr>
    <tr>
        <td>key</td>
        <td>value</td>
    </tr>
</table>

Похоже, что первый tr пропущен (заголовки), а затем у вас есть только 2 столбца, которые вы хотите соединить как KEY => VALUE;

$cols = $row->getElementsByTagName('td');
$key = $cols->item(0)->nodeValue; // string(3) "key"
$val = $cols->item(1)->nodeValue; // string(5) "value"

Приведенный выше код вернет нужные вам предметы.

Добро пожаловать на сайт PullRequest, где вы можете задавать вопросы и получать ответы от других членов сообщества.
...