解决Python Requests爬取登录网站406错误的实战教程-html教程-PHP中文网

解决Python Requests爬取登录网站406错误的实战教程

心靈之曲

发布： 2025-10-31 11:14:12

原创

534人浏览过

解决Python Requests爬取登录网站406错误的实战教程

本教程旨在解决使用python `requests`库爬取需要登录的网站时遇到的“406 not acceptable”错误。核心内容是揭示服务器端对http请求头部的验证机制，并提供通过添加或修改关键http头部（如`user-agent`）来模拟浏览器行为的解决方案，确保python爬虫能够成功进行身份验证并获取数据。

在进行网络数据抓取时，尤其是针对需要用户登录的平台，我们经常会遇到请求被服务器拒绝的情况。即使提供了正确的用户名和密码，POST请求也可能返回“406 Not Acceptable”状态码。这通常不是认证信息本身的问题，而是服务器对请求头部的严格校验导致的。许多网站会检查请求的User-Agent等头部信息，以识别并阻止非浏览器发起的自动化请求。

遇到的问题示例

假设我们尝试使用requests库登录一个交易平台（如Plus500），并获取实时市场数据。初始代码可能如下所示：

import requests
from pprint import pprint
# 假设Config模块中定义了username和password
# from Config import username, password 

# 示例用户名和密码，实际应用中应从安全配置中加载
username = "your_email@example.com"
password = "YourRandomCode87"

def main():
    # 目标登录URL，通常包含一些会话或追踪参数
    url = 'https://app.plus500.com/trade?innerTags=_cc_&webvisitid=d9cf772d-6ad5-492c-b782-e3fbeaf7863d&page=login' \
          '&_ga=2.35401569.1585895796.1661533386-1432537898.1661336007 '

    with requests.Session() as session:
        # 使用session发送POST请求，并尝试进行HTTP基本认证
        response = session.post(url, auth=(username, password))
        pprint(response.text)

if __name__ == '__main__':
    main()

登录后复制

运行上述代码后，我们可能会得到类似以下的响应：

('{\n'
 '  "status": "Rejected",\n'
 '  "statusCode": "406",\n'
 '  "supportID": "...",\n'
 '  "ipAddress": "my IP",\n'
 '  "timeStamp": "2022-08-27 12:30:47"\n'
 '}')

登录后复制

响应明确指出status: "Rejected"和statusCode: "406"，这意味着服务器拒绝了我们的请求，通常是由于请求的头部不符合服务器的预期。

立即学习“Python免费学习笔记（深入）”；

解决方案：模拟浏览器请求头

解决这类问题的关键在于让我们的Python脚本尽可能地模拟一个真实的浏览器行为。这通常通过在请求中添加或修改HTTP头部信息来实现。最常见的也是最重要的头部是User-Agent，它标识了发出请求的客户端类型。此外，Accept-Encoding、Accept、Accept-Language和Connection等头部也常用于模拟浏览器。

核心HTTP头部解释：

User-Agent: 告诉服务器客户端的类型、操作系统和浏览器版本。这是最常用于识别和过滤自动化请求的头部。
Accept-Encoding: 告知服务器客户端支持的编码方式（如gzip, deflate），以便服务器可以压缩响应内容。
Accept: 告知服务器客户端能够处理的媒体类型（MIME类型），例如text/html, application/xhtml+xml等。
Accept-Language: 告知服务器客户端偏好的语言。
Connection: 控制网络连接的选项，keep-alive表示客户端希望保持连接以便后续请求复用。

修正后的代码示例

通过在requests.post方法中添加headers参数，我们可以解决上述问题：

码上飞

码上飞（CodeFlying）是一款AI自动化开发平台，通过自然语言描述即可自动生成完整应用程序。

449

查看详情

import requests
from pprint import pprint
# 假设Config模块中定义了username和password
# from Config import username, password 

# 示例用户名和密码，实际应用中应从安全配置中加载
username = "your_email@example.com"
password = "MyRandomCode87"

def main():
    url = 'https://app.plus500.com/trade?innerTags=_cc_&webvisitid=d9cf772d-6ad5-492c-b782-e3fbeaf7863d&page=login' \
          '&_ga=2.35401569.1585895796.1661533386-1432537898.1661336007 '

    # 定义模拟浏览器行为的HTTP头部
    headers = {
        "User-Agent": "Mozilla/5.0 (Windows NT 6.1; WOW64; rv:20.0) Gecko/20100101 Firefox/20.0",
        "Accept-Encoding": "gzip, deflate",
        "Accept": "text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8",
        "Accept-Language": "en-US,en;q=0.5",
        "Connection": "keep-alive"
    }

    with requests.Session() as session:
        # 在POST请求中加入headers参数
        response = session.post(url, auth=(username, password), headers=headers)
        pprint(response.text)

if __name__ == '__main__':
    main()

登录后复制

通过添加这些头部，服务器将更倾向于将我们的请求视为来自合法浏览器，从而允许认证和后续的数据访问。

如何确定必要的HTTP头部

在实际的爬虫开发中，我们可能需要更精确地确定哪些头部是必需的。以下是一些常用的方法：

浏览器开发者工具（Developer Tools）:
- 打开目标网站的登录页面。
- 按F12（或右键点击页面 -> 检查）打开开发者工具。
- 切换到“Network”（网络）选项卡。
- 进行登录操作，观察登录请求（通常是POST请求）。
- 点击该请求，查看其“Request Headers”（请求头部）部分。
- 复制其中关键的头部信息到你的Python代码中。User-Agent是首要关注的，但有时也需要Referer、Origin、Content-Type等。
逐步测试: 如果不确定哪些头部是必需的，可以从User-Agent开始，然后逐步添加其他头部，直到请求成功。
阅读网站的Robots.txt和使用条款: 在进行任何爬取活动之前，务必检查网站的robots.txt文件，了解允许或禁止爬取的部分。同时，仔细阅读网站的服务条款，确保你的行为符合规定，避免不必要的法律风险。

注意事项与最佳实践

尊重网站政策: 始终遵守网站的robots.txt协议和使用条款。未经授权的爬取可能导致IP被封禁，甚至引发法律问题。
频率控制: 不要以过高的频率发送请求，这可能被服务器识别为DDoS攻击。使用time.sleep()在请求之间添加延时。
异常处理: 编写健壮的代码来处理网络错误、超时、不同的HTTP状态码等异常情况。
动态User-Agent: 为了进一步模拟真实用户，可以维护一个User-Agent列表，并在每次请求时随机选择一个。
Cookie管理: requests.Session会自动处理Cookie，这对于维护登录状态至关重要。
代理IP: 如果IP被封禁，可以考虑使用代理IP池来轮换IP地址。

总结

当使用Python requests库爬取需要登录的网站时遇到“406 Not Acceptable”等拒绝访问的问题，通常是由于请求头部不符合服务器的预期。通过模拟浏览器发送的HTTP头部，特别是User-Agent，可以有效解决这类问题。理解并正确设置这些头部是成功进行网络数据抓取的关键一步。在实践中，结合浏览器开发者工具分析实际请求头，并遵循网络爬取的最佳实践和道德规范，将有助于更高效、更稳定地获取所需数据。

以上就是解决Python Requests爬取登录网站406错误的实战教程的详细内容，更多请关注php中文网其它相关文章！