【爬虫实战】用python爬小红书某话题的笔记，以#杭州亚运会#为例

2023-10-07 09:24 由马哥python说发表于 #后端开发

一、爬取目标
二、爬虫代码讲解
- 2.1 分析过程
- 2.2 爬虫代码
三、演示视频
四、获取完整代码

一、爬取目标

您好！我是@马哥python说，一名10年程序猿。

最近的亚运会大家都看了吗。除了振奋人心，还主打一个爱憎分明（主要针对小日子和韩国），看了的小伙伴都懂得！

我用python爬取了小红书上 #杭州亚运会这个话题下的所有笔记，目标如下：

爬取结果如下：

共7个核心字段，含:

笔记标题, 笔记id, 笔记链接, 作者昵称, 作者id, 作者链接, 发布时间。

二、爬虫代码讲解

2.1 分析过程

核心思路，通过网页端分析接口数据实现。
点击手机客户端右上角分享按钮，然后选择复制链接，如下：

把复制好的链接粘贴到电脑端浏览器，并打开开发者模式，如下：

页面往下滚动，刷出更多笔记数据，打开以notes开头的请求链接，查看预览数据：

由此便得到了前端请求链接，下面开始开发爬虫代码。

2.2 爬虫代码

首先，导入需要用到的库：

import requests  # 发送请求
import random
from time import sleep  # 设置等待，防止反爬
import time
import pandas as pd  # 保存csv
import datetime
import os

定义一个请求头：

# 请求头
h1 = {
	'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/86.0.4240.198 Safari/537.36',
}

由于我并不知道一共有多少页，往下翻多少次，所以采用while循环，直到触发终止条件，循环才结束。

那么怎么定义终止条件呢？我注意到，在返回数据里有一个叫做"has_more"的参数，大胆猜测它的含义，是否有更多数据，正常情况它的值是true。如果它的值是false，代表没有更多数据了，即到达最后一页了，也就该终止循环了。

因此，核心代码结构应该是这样（以下是伪代码，主要是表达逻辑，请勿直接copy）：

while True:
	# 发送请求
	r = requests.get(url, headers=h1)
	# 解析数据
	json_data = r.json()
	# 逐条解析
	for i in json_data['data']['notes']:
		# 笔记标题
		title = i['title']
		title_list.append(title)
	# 保存数据到csv
	。。。
	# 判断终止条件
	next_cursor = json_data['data']['cursor']
	if not json_data['data']['has_more']:
		print('没有下一页了，终止循环！')
		break
	page += 1

另外，还有一个关键问题，如何进行翻页。
查看请求参数，如下：

这里的游标，就是向下翻页的依据，因为每次请求的返回数据中，也有一个cursor：

大胆猜测，返回数据中的cursor，就是给下一页请求用的cursor，所以，这部分的逻辑实现应该如下（以下是伪代码，主要是表达逻辑，请勿直接copy）：

while True:
	# 判断是否首页
	if page == 1:
		url = 'https://www.xiaohongshu.com/web_api/sns/v3/page/notes?page_size=6&sort=hot&page_id={}&sid='.format(
			page_id)
	else:
		url = 'https://www.xiaohongshu.com/web_api/sns/v3/page/notes?page_size=6&sort=hot&page_id={}&sid=&cursor={}'.format(
			page_id, next_cursor)
	# 发送请求
	r = requests.get(url, headers=h1)
	# 解析数据
	json_data = r.json()
	# 得到下一页的游标
	next_cursor = json_data['data']['cursor']

最后，是顺理成章的保存csv数据：

# 保存数据到DF
df = pd.DataFrame(
	{
		'页码': page,
		'笔记标题': title_list,
		'笔记id': note_id_list,
		'作者昵称': author_name_list,
		'作者id': author_id_list,
		'发布时间': create_time_list,
	}
)
# 保存到csv
df.to_csv(result_file, mode='a+', header=header, index=False, encoding='utf_8_sig')

至此，爬虫代码开发完毕。

完整代码中，还包含转换时间戳、随机等待时长、解析关键字段、保存Dataframe数据等逻辑实现，详见文末。

三、演示视频

代码演示：【Python爬虫演示】爬取小红书话题笔记，以#杭州亚运会#为例

四、获取完整代码

爱学习的小伙伴，本次分析过程的完整python源码及结果数据，我已打包好，并上传至我的微信公众号"老男孩的平凡之路"，后台回复"爬小红书话题"即可获取。点击直达

我是@马哥python说，一名10年程序猿，持续分享python干货中！

【爬虫实战】用python爬今日头条热榜TOP50榜单！

目录一、爬取目标二、爬取结果三、代码讲解四、技术总结五、演示视频六、附完整源码一、爬取目标您好！我是@马哥python说，一名10年程序猿。今天分享一期爬虫案例，爬取的目标是：今日头条热榜的榜单数据。打开今日头条首页，在页面右侧会看到头条热榜，如下：爬取以上6个关键字段，含：热榜排名, ...阅读全文

【爬虫实战】用python爬豆瓣电影《热烈》短评

[toc] # 一、爬虫对象-豆瓣电影短评您好！我是[@马哥python说](https://www.cnblogs.com/mashukui/)，一名10年程序猿。今天分享一期爬虫案例，爬取的目标是：豆瓣上任意一部电影的短评（注意：是短评，不是影评！），以《热烈》这部电影为例： ![爬取目标] ...阅读全文

Python 爬虫实战：驾驭数据洪流，揭秘网页深处

**爬虫，这个经常被人提到的词，是对数据收集过程的一种形象化描述。特别是在Python语言中，由于其丰富的库资源和良好的易用性，使得其成为编写爬虫的绝佳选择。本文将从基础知识开始，深入浅出地讲解Python爬虫的相关知识，并分享一些独特的用法和实用技巧。本文将以实际的网站为例，深入阐述各个处理部分， ...阅读全文

【python爬虫实战】用python爬取爱奇艺电视剧十大榜单的全部数据！

[toc] # 一、爬取目标本次爬取的目标是，爱奇艺电视剧类目下的10个榜单：[电视剧风云榜-爱奇艺风云榜](https://www.iqiyi.com/ranks1/2/0) ![爱奇艺页面](https://img2023.cnblogs.com/blog/2864563/202306/28 ...阅读全文

基于AI模型的验证码安全识别(B站，知乎等)

基于使用AI模型解决B站,知乎等平台的安全验证问题，比如滑块验证，数字识别验证，汉字点击顺序验证，旨在解决爬虫爬取数据过程中的一些反爬措施，仅做学习参考 ...阅读全文

Flutter/Dart第10天：Dart高级特性Pattern模式的全部类型（共15种）

Pattern模式是Dart 3.0发布的3个高级特性之一，在第09天我们学习了模式的概览和用法，对模式的强大之处有了基本的认识，今天我们来看看Dart中的全部模式类型，总共有15种，它们包括逻辑或、逻辑与、关系、值转换、空检测、空断言、常量、变量、标识符、括号、List列表、Map映射、Recor... ...阅读全文

IoC容器

IoC容器是Spring框架的核心组成部分之一。它是一个负责对象创建、组装和管理的容器，通过控制对象的创建和依赖关系的注入，实现了对象之间的解耦和灵活性。在传统的编程模型中，对象的创建和控制权通常由开发者负责，开发者需要手动实例化对象、处理对象之间的依赖关系并进行组装，这样的过程非常繁琐且容易出错。... ...阅读全文

【中秋国庆不断更】HarmonyOS对通知类消息的管理与发布通知（上）

【中秋国庆不断更】HarmonyOS对通知类消息的管理与发布通知（上）一、通知概述通知简介应用可以通过通知接口发送通知消息，终端用户可以通过通知栏查看通知内容，也可以点击通知来打开应用。通知常见的使用场景： ● 显示接收到的短消息、即时消息等。 ● 显示应用的推送消息，如广告、版本 ...阅读全文

邮件发送，附件太大怎么办 → 那就用分卷压缩吧

开心一刻昨晚，老婆辅导女儿写作业有一道形容妈妈的题，女儿写下了：我妈妈像一个暴躁的老虎老婆拿起题册轻轻敲了下女儿，生气到：有这么形容你妈的吗女儿：你看你现在老婆：我有那么暴躁吗，你就不能说我妈妈像一个公主，温柔大方漂亮？女儿：题目让我造句，没让我造谣！我：哈哈哈哈！邮件发送基于 J ...阅读全文

Flutter/Dart第03天：Dart可迭代集合

在Dart学习的第02天，我们通过基础语法说明和样例代码的方式，学习了Dart的16个基础语法，这些基础语法给我们后面编写的Flutter程序打下来坚实基础。今天，我们继续深入学习Dart乃至所有编程语言都非常重要的部分：可迭代的集合…… ...阅读全文