当前位置:  编程技术>python

python 自动提交和抓取网页

    来源: 互联网  发布时间:2014-09-04

    本文导语:  下面是用python写的,使用lxml来做html分析,从网上看到的,说是分析速度最快的哦,不过没有验证过。好了,上代码。 代码如下: import urllib import urllib2 import urlparse import lxml.html def url_with_query(url, values): parts = urlparse.urlparse(url) ...

下面是用python写的,使用lxml来做html分析,从网上看到的,说是分析速度最快的哦,不过没有验证过。好了,上代码。
代码如下:

import urllib
import urllib2
import urlparse
import lxml.html
def url_with_query(url, values):
parts = urlparse.urlparse(url)
rest, (query, frag) = parts[:-2], parts[-2:]
return urlparse.urlunparse(rest + (urllib.urlencode(values), None))
def make_open_http():
opener = urllib2.build_opener(urllib2.HTTPCookieProcessor())
opener.addheaders = [] # pretend we're a human -- don't do this
def open_http(method, url, values={}):
if method == "POST":
return opener.open(url, urllib.urlencode(values))
else:
return opener.open(url_with_query(url, values))
return open_http
open_http = make_open_http()
tree = lxml.html.fromstring(open_http("GET", "http://www.").read())
form = tree.forms[0]
form.fields["q"] = "eplussoft"
form.action="http://www./search"
response = lxml.html.submit_form(form,open_http=open_http)
html = response.read()
doc = lxml.html.fromstring(html)
lxml.html.open_in_browser(doc)

恩,验证码是个大问题。还有今天看了一些百度贴吧上的东西,更是坏了心情,它的验证码是用ajax取的图片,这就更加麻烦了。不过好像现在大多数的论坛和博客的验证码都是这样的了。这样第一次抓取下来的页面就不会包含有验证码图片了,更不要说分析验证码图片了。要解决的问题还是很多的。。。

    
 
 

您可能感兴趣的文章:

  • 基于python实现的网络爬虫功能:自动抓取网页介绍
  • python采用requests库模拟登录和抓取数据的简单示例
  • python抓取网页内容示例分享
  • python抓取网页中的图片示例
  • Python抓取Discuz!用户名脚本代码
  • python抓取豆瓣图片并自动保存示例学习
  • python抓取京东价格分析京东商品价格走势
  • 使用python BeautifulSoup库抓取58手机维修信息
  • python小技巧之批量抓取美女图片
  • python使用beautifulsoup从爱奇艺网抓取视频播放
  • python抓取京东商城手机列表url实例代码
  • python抓取网页图片示例(python爬虫)
  • python抓取网页图片并放到指定文件夹
  • python抓取网页时字符集转换问题处理方案分享
  • python正则匹配抓取豆瓣电影链接和评论代码分享
  • python正则表达式抓取成语网站
  • python抓取某汽车网数据解析html存入excel示例
  • 深度剖析使用python抓取网页正文的源码
  • python多线程抓取天涯帖子内容示例
  • Python使用代理抓取网站图片(多线程)
  • Python代理抓取并验证使用多线程实现
  • 在Python3中使用urllib实现http的get和post提交数据操作
  • 用Python的urllib库提交WEB表单
  • python连接mysql并提交mysql事务示例
  • Python实现的百度站长自动URL提交小工具
  •  
    本站(WWW.)旨在分享和传播互联网科技相关的资讯和技术,将尽最大努力为读者提供更好的信息聚合和浏览方式。
    本站(WWW.)站内文章除注明原创外,均为转载、整理或搜集自网络。欢迎任何形式的转载,转载请注明出处。












  • 相关文章推荐
  • Python获取网页编码的方法及示例代码
  • 使用python Django做网页
  • Python3通过request.urlopen实现Web网页图片下载
  • python获取网页状态码示例
  • python实现保存网页到本地示例
  • python实现网页链接提取的方法分享
  • Python天气预报采集器实现代码(网页爬虫)
  • Python中使用 Selenium 实现网页截图实例
  • 解决谷歌搜索技术文章时打不开网页问题的python脚本
  • 测试、预发布后用python检测网页是否有日常链接
  • Python通过解析网页实现看报程序的方法
  • python通过urllib2爬网页上种子下载示例
  • python网页请求urllib2模块简单封装代码
  • python编写网页爬虫脚本并实现APScheduler调度
  • Python GUI编程:tkinter实现一个窗口并居中代码
  • 让python同时兼容python2和python3的8个技巧分享
  • Python不使用print而直接输出二进制字符串
  • 使用setup.py安装python包和卸载python包的方法
  • Python中实现json字符串和dict类型的互转
  • 不小心把linux自带的python卸载了,导致安装一个依赖原python的软件不能安装,请问该怎么办?
  • python异常信息堆栈输出到日志文件
  • Python开发者社区整站源码 Pythoner
  • python下用os.execl执行centos下的系统时间同步命令ntpdate
  • python读取csv文件示例(python操作csv)
  • Python namedtuple对象json序列化/反序列化及对象恢复
  • python基础教程之python消息摘要算法使用示例
  • Python异常模块traceback用法举例
  • 新手该如何学python怎么学好python?
  • python之平台独立的调试工具winpdb介绍
  • 使用python删除nginx缓存文件示例(python文件操作)
  • 基于Python的Html/xml解析库Beautiful Soup 4.2.1发布


  • 站内导航:


    特别声明:169IT网站部分信息来自互联网,如果侵犯您的权利,请及时告知,本站将立即删除!

    ©2012-2021,,E-mail:www_#163.com(请将#改为@)

    浙ICP备11055608号-3