Учитывая вариант использования Django, есть два ответа на это. Вот его django.utils.html.escape
функция, для справки:
def escape(html):
"""Returns the given HTML with ampersands, quotes and carets encoded."""
return mark_safe(force_unicode(html).replace('&', '&').replace('<', '&l
t;').replace('>', '>').replace('"', '"').replace("'", '''))
Чтобы изменить это, функция Cheetah, описанная в ответе Джейка, должна работать, но в ней отсутствует одинарная кавычка. Эта версия включает в себя обновленный кортеж, порядок замены которого изменен, чтобы избежать симметричных проблем:
def html_decode(s):
"""
Returns the ASCII decoded version of the given HTML string. This does
NOT remove normal HTML tags like <p>.
"""
htmlCodes = (
("'", '''),
('"', '"'),
('>', '>'),
('<', '<'),
('&', '&')
)
for code in htmlCodes:
s = s.replace(code[1], code[0])
return s
unescaped = html_decode(my_string)
Это, однако, не является общим решением; он подходит только для строк, закодированных с django.utils.html.escape
. В целом, лучше придерживаться стандартной библиотеки:
# Python 2.x:
import HTMLParser
html_parser = HTMLParser.HTMLParser()
unescaped = html_parser.unescape(my_string)
# Python 3.x:
import html.parser
html_parser = html.parser.HTMLParser()
unescaped = html_parser.unescape(my_string)
# >= Python 3.5:
from html import unescape
unescaped = unescape(my_string)
В качестве предложения: может иметь больше смысла хранить неэкранированный HTML-код в вашей базе данных. Было бы целесообразно по возможности вернуть неэкранированные результаты из BeautifulSoup и вообще избежать этого процесса.
В Django экранирование происходит только во время рендеринга шаблона; поэтому, чтобы избежать побега, просто скажите шаблонизатору, чтобы он не избегал строки. Для этого воспользуйтесь одним из следующих параметров в вашем шаблоне:
{{ context_var|safe }}
{% autoescape off %}
{{ context_var }}
{% endautoescape %}