博客
关于我
python爬虫实践之爬取豆瓣高评分电影
阅读量:257 次
发布时间:2019-03-01

本文共 1472 字,大约阅读时间需要 4 分钟。

爬取豆瓣高评分电影的实现

概述

本文将介绍如何通过编程实现豆瓣高评分电影的爬取,涵盖从准备到完成爬虫的全过程。

准备

所需模块

  • requests 模块用于发送HTTP请求
  • re 模块用于文本处理

涉及知识点

  • Python基础
  • requests 模块基础使用
  • re 模块基础使用

爬虫代码

URL规律

通过分析网页可得,URL格式如下:

https://movie.douban.com/j/new_search_subjects?sort=S&range=0,10&tags=&start={(page_index-1)*20}

其中,page_index 表示页码。

请求头设置

headers = {    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.81 Safari/537.36"}

爬取逻辑

代码实现如下:

import reimport requestsdef get_douban_high_ratings(page_num):    base_url = "https://movie.douban.com/j/new_search_subjects?sort=S&range=0,10&tags="    start = (page_num - 1) * 20    url = f"{base_url}&start={start}"        response = requests.get(url, headers=headers).text    response = re.sub(r"\\", "", response)        # 提取数据    pat_title = r'"title":"(.*?)",'    pat_rate = r'"rate":"(.*?)",'    pat_url = r'"url":"(.*?)",'        data_title = re.compile(pat_title).findall(response)    data_rate = re.compile(pat_rate).findall(response)    data_url = re.compile(pat_url).findall(response)        return data_title, data_rate, data_url# 输入要爬取的总记录数page_num = int(input("请输入您想爬取的总记录数(每20条为一个页面):"))titles, rates, urls = get_douban_high_ratings(page_num)for title, rate, url in zip(titles, rates, urls):    print(f"{title}\t\t{rate}")

运行效果

运行上述代码后,您可以在控制台看到如下结果:

电影标题    评分--------------------------------------------------------电影名称1    9.0电影名称2    8.9...

总结

通过上述方法,我们成功实现了对豆瓣高评分电影的爬取。该方法基于requests和re模块,能够高效地获取所需数据。

转载地址:http://pqzx.baihongyu.com/

你可能感兴趣的文章
Mysql学习总结(58)——深入理解Mysql的四种隔离级别
查看>>
Mysql学习总结(59)——数据库分库分表策略总结
查看>>
Mysql学习总结(5)——MySql常用函数大全讲解
查看>>
Mysql学习总结(60)——并发量大、数据量大的互联网业务数据库设计规范总结
查看>>
Mysql学习总结(61)——MySQL优化之DBA级优化整理汇总
查看>>
Mysql学习总结(62)——MySQL连接com.mysql.jdbc.exceptions.jdbc4.CommunicationsException: Communications link问题
查看>>
Mysql学习总结(63)——Mysql数据库架构方案选择与分析
查看>>
Mysql学习总结(64)——Mysql配置文件my.cnf各项参数解读
查看>>
Mysql学习总结(65)——项目实战中常用SQL实践总结
查看>>
Mysql学习总结(66)——设置MYSQL数据库编码为UTF-8
查看>>
Mysql学习总结(67)——MYSQL慢查询日志
查看>>
Mysql学习总结(68)——MYSQL统计每天、每周、每月、每年数据 SQL 总结
查看>>
Mysql学习总结(69)——Mysql EXPLAIN 命令使用总结
查看>>
Mysql学习总结(6)——MySql之ALTER命令用法详细解读
查看>>
Mysql学习总结(70)——MySQL 优化实施方案
查看>>
Mysql学习总结(71)——MySQL 重复记录查询与删除总结
查看>>
Mysql学习总结(71)——数据库介绍(MySQL安装 体系结构、基本管理)再回顾
查看>>
Mysql学习总结(73)——MySQL 查询A表存在B表不存在的数据SQL总结
查看>>
Mysql学习总结(76)——MySQL执行计划(explain)结果含义总结
查看>>
Mysql学习总结(77)——温故Mysql数据库开发核心原则与规范
查看>>