当前位置:  编程语言>python

基于Python的Html/xml解析库Beautiful Soup 4.2.1发布

 
分享到:
    发布时间:2013-8-2  


    本文导语:  BeautifulSoup是一个用来解析HTML/XML文档的库,它的主要特点:1.Beautiful Soup提供了一些非常简单的方法以及以Python编程语言的习惯方式来进行浏览,搜索和修改文档树,它能够让你快速地对文档进行分析,并能够从文档中提取任...

 BeautifulSoup是一个用来解析HTML/XML文档的库,它的主要特点:

1.Beautiful Soup提供了一些非常简单的方法以及以Python编程语言习惯方式来进行浏览,搜索修改文档

树,它能够让你快速地对文档进行分析,并能够从文档中提取任何你想要的内容

2.beautiful soup能够自动识别输入文档的编码,并将其统一转换成utf-8,我们在使用库时,可以完全不用考虑

编码相关的问题,但是当输入文档中没有编码相关的信息时,在使用库时则必须制定输入文档的编码。

3.Beautiful Soup基于流行的Python解析器lxml和html5lib,在使用时具有很大灵活性,允许你尝试不同的

解析策略。    

 Beautiful Soup自动遍历并析输入的文档,并可以执行诸如以下类型的任务:

1.找到文档中所有超链接

2.找到文档中具有class属性为externalLink的所有超链接

3.找到所有URL为foo.com的超链接

4.找到table heading中加粗的文本


Beautiful Soup 4能够在Python 2 (2.6+)和 Python 3下运行。

Beautiful Soup 4.2.1下载地址:  Beautiful Soup 4.2.1

 


  • 本站(WWW.169IT.COM)旨在分享和传播互联网科技相关的资讯和技术,将尽最大努力为读者提供更好的信息聚合和浏览方式。
    本站(WWW.169IT.COM)站内文章除注明原创外,均为转载,整理或搜集自网络.欢迎任何形式的转载,转载请注明出处.
    转载请注明:文章转载自:[169IT-IT技术资讯]
    本文标题:基于Python的Html/xml解析库Beautiful Soup 4.2.1发布
相关文章推荐:
  • Python GUI编程:tkinter实现一个窗口并居中代码
  • 让python同时兼容python2和python3的8个技巧分享
  • Python不使用print而直接输出二进制字符串
  • 使用setup.py安装python包和卸载python包的方法
  • Python中实现json字符串和dict类型的互转
  • 不小心把linux自带的python卸载了,导致安装一个依赖原python的软件不能安装,请问该怎么办?
  • python异常信息堆栈输出到日志文件
  • python读取csv文件示例(python操作csv)
  • python下用os.execl执行centos下的系统时间同步命令ntpdate
  • python基础教程之python消息摘要算法使用示例
  • Python namedtuple对象json序列化/反序列化及对象恢复
  • 新手该如何学python怎么学好python?
  • Python获取网页编码的方法及示例代码
  • 使用python删除nginx缓存文件示例(python文件操作)
  • Python异常模块traceback用法举例
  • python学习手册中的python多态示例代码
  • python之平台独立的调试工具winpdb介绍
  • 请教:system("C:\python2.4\python.exe C:\aa.py");该语句有何错误?为什么运行界面一闪就消失了并且没有运行完,请给出正确语句!
  • 测试Python内部类型及type和isinstance用法区别
  • python版本的问题
  • Python3中内置类型bytes和str用法及byte和string之间各种编码转换
  • Mac OS X10.9安装的Python2.7升级Python3.3步骤详解


  • 站内导航:


    特别声明:169IT网站部分信息来自互联网,如果侵犯您的权利,请及时告知,本站将立即删除!

    ©2012-2017,169IT.COM,E-mail:www_169it_com#163.com(请将#改为@)

    浙ICP备11055608号