Python处理HTML转义字符

内容简介：Python处理HTML转义字符

抓网页数据经常遇到例如 > 或者   这种HTML转义符，抓到字符串里很是烦人。

比方说一个从网页中抓到的字符串

html = '&lt;abc&gt;'

用 Python 可以这样处理：

import HTMLParser
html_parser = HTMLParser.HTMLParser()
txt = html_parser.unescape(html) #这样就得到了txt = '<abc>'

如果还想转回去，可以这样：

import cgi
html = cgi.escape(txt) # 这样又回到了 html = '&lt;abc&gt'

来回转的功能还分了两个模块实现，挺奇怪。没找到更优美的方法，欢迎补充哈~

以上就是本文的全部内容，希望本文的内容对大家的学习或者工作能带来一定的帮助，也希望大家多多支持码农网

查看所有标签

猜你喜欢:

本站部分资源来源于网络，本站转载出于传递更多信息之目的，版权归原作者或者来源机构所有，如转载稿涉及版权问题，请联系我们。

码农书籍

勇敢新世界‧互聯網罪與罰

許煜、劉細良 / CUP / 2005 / $48

我天天上網數小時，為的是要在節目裡面介紹世界的最新動態，尤其是網絡這個世界本身日新月異的變化。所以我不可能不注意到BT、共享軟件、 Wikipedia、網絡監管等各種影響政治、社會、經濟及文化的重要網絡現象。但是我發現市面上一直沒有一本內容充實全面，資料切時的中文參考書，直到這本《互聯網罪與罰》。而且，最大的驚喜是它易讀好看，簡直就像故事書。梁文道鳳凰衛視《網羅天下......一起来看看《勇敢新世界‧互聯網罪與罰》这本书的介绍吧!

码农工具

Python处理HTML转义字符

勇敢新世界‧互聯網罪與罰

在线进制转换器

图片转BASE64编码

MD5 加密