用python第三方库requests抓取淘宝搜索结果页面,response并不是html结构。。

怎么得到html
2024-11-11 23:19:44
推荐回答(3个)
回答1:

您好,首先,sys.setdefaultencoding is evil。
其次,不会用 Requests 就去看文档,不要乱来。
如果 Requests 检测不到正确的编码,那么你告诉它正确的是什么:
response.encoding = 'gbk'
print response.text
原始内容在 response.content 里,bytes,自己想怎么处理就怎么处理。

单个请求完全没必要用 Session。直接 requests.get(xxx) 就可以了。
最后,弄不明白怎么处理编码错误的字符串就仔细想想,或者用 Python 3.x,不要散弹枪编程。
以下是 Python 3。Python 2 在那个字符串前加个 u 告诉它是 unicode 也一样。

回答2:

那是动态网页,不能用这种方法,要是能直接response,那淘宝的反爬虫部门还混个毛线啊。

回答3:

这个要使用python生成html哦, 不是自动生成的哦, 能看看wo 的网名吧?》一定能解决的哦!!