推广 热搜： 2025 2024 金中国设备行业公司快速上海企业

Python 抓取微信公众号账号信息

日期：2024-12-16 移动：http://www78564.xrbh.cn/mobile/quote/26959.html

搜狗微信搜索提供两种类型的关键词搜索，一种是搜索公众号文章内容，另一种是直接搜索微信公众号。通过微信公众号搜索可以获取公众号的基本信息及最近发布的10条文章，今天来抓取一下微信公众号的账号信息

爬虫

首先通过首页进入，可以按照类别抓取，通过“查看更多”可以找出页面链接规则：

import requests as req
import re

reTypes = r'id="pc_d*" uigs="(pc_d*)">([sS]*?)</a>'
Entry = "http://weixin.sogou.com/"
entryPage = req.get(Entry)
allTypes = re.findall(reTypes, getUTF8(entryPage))

for (pcid, category) in allTypes:
    for page in range(1, 100):
        url = 'http://weixin.sogou.com/pcindex/pc/{}/{}.html'.format(pcid, page)
        print(url)

        categoryList = req.get(url)
        if categoryList.status_code != 200:
            break

上面代码通过加载更多页面获取加载列表，进而从其中抓取微信公众号详情页面：

reProfile = r'<li id[sS]*?<a href="([sS]*?)"'
allProfiles = re.findall(reOAProfile, getUTF8(categoryList))
for profile in allProfiles:
    profilePage = req.get(profile)
    if profilePage.status_code != 200:
        continue

进入详情页面可以获取公众号的等信息：

大家在学python的时候肯定会遇到很多难题，以及对于新技术的追求，这里推荐一下我们的Python学习扣qun：784758214，这里是python学习者聚集地！！同时，自己是一名高级python开发工程师，从基础的python脚本到web开发、爬虫、django、数据挖掘等，零基础到项目实战的资料都有整理。送给每一位python的小伙伴！每日分享一些学习的方法和需要注意的小细节

点击：python技术分享

注意事项

详情页面链接：

1. 验证码

访问详情页面时有可能需要验证码，自动识别验证码还是很有难度的，因此要做好爬虫的伪装工作。

2. 未保存详情页面链接

详情页面的链接中有两个重要参数：，这说明页面链接是有时效性的，所以保存下来应该也没用；

3. 二维码

二维码图片链接同样具有时效性，因此如需要最好将图片下载下来。

用 Flask 展示结果

最近 Python 社区出现了一款异步增强版的 Flask 框架： Sanic ，基于 uvloop 和 httptools ，可以达到异步、更快的效果，但保持了与 Flask 一致的简洁语法。虽然项目刚起步，还有很多基本功能为实现，但已经获得了很多关注（ 2,222 Star ）。这次本打算用抓取的微信公众号信息基于 Sanic 做一个简单的交互应用，但无奈目前还没有加入模板功能，异步的 redis 驱动也还有 BUG 没解决，所以简单尝试了一下之后还是切换回 Flask + SQLite，先把抓取结果呈现出来，后续有机会再做更新。

安装 Sanic

Debug Sanic

Flask + SQLite App

本文地址：http://www78564.xrbh.cn/quote/26959.html 迅博思语 http://www78564.xrbh.cn/ , 查看更多

特别提示：本信息由相关用户自行提供，真实性未证实，仅供参考。请谨慎采用，风险自负。

相关最新动态

推荐最新动态

点击排行