python 爬虫基本使用——统计杭电oj题目正确率并排序

脚本专栏 2024/12/24 佚名

3 1 2

快活林资源网 Design By www.csstdc.com

　　python爬虫主要用两个库：Urllib和BeautifulSoup4。一个用来爬取网页，一个用来解析网页。

　　Urllib是Python内置的HTTP请求库，它包含四个模块：

　　1、request，最基本的 HTTP 请求模块，用来模拟发送请求，就像在浏览器里输入网址然后敲击回车一样，只需要给库方法传入 URL 与额外的参数，就可以模拟这个过程。
　　2、error ，异常处理模块，如果出现请求错误，我们可以捕获这些异常，然后进行重试或其他操作保证程序不会意外终止。
　　3、parse ，工具模块，提供了许多 URL 处理方法，比如拆分、解析、合并等。
　　4、robotparser，主要用于识别网站的 robots.txt 文件，判断网站是否可以爬取，用的较少。

　　这里只用到了最常用的request。

　　BeautifulSoup4从bs4包中导出，这里主要用的就是它的解析功能。

　　代码如下，注释写得很清楚了：

#杭电OJ题目AC率排序

import urllib.request as ur
from bs4 import BeautifulSoup 

dic = {} #存："题号：题名 AC 提交次数 正确率"
for t in range(1,59,1):#1~58页都爬一遍
 print(t)
 url = 'http://acm.hdu.edu.cn/listproblem.php"html.parser")#获取网址的html并转换为可以python可以使用的结构
 ql0 = str(bs.body.table.contents[11].td.table.contents[1])#网页的DOM解析后可以直接通过"."来寻找子元素，找到题目的列表元素后，将列表中所有题目转换成字符串。（可以输出看看）
 ql = ql0[30:-10].split(";") #字符串中的题目以";"分隔，将它们分开，并存到列表中

 for i in ql: #以下就是格式化处理每个题目，然后存到字典中
  info1 = i.split(',"',1)
  num = info1[0].split(',')[1]
  info2 = info1[1].split('",',1)
  name = info2[0]
  right,submit = info2[1].split(',',1)
  submit = submit[:-1] 
  dic[num] = [name,int(right),int(submit),int(right)/int(submit)]
dic = sorted(dic.items(),key = lambda x: x[1][3]) #每页题目都存入字典后，把字典中的题目通过正确率进行排序，传出列表

with open('Statistics.txt','w',encoding = 'utf-8') as f:#把统计排序好的题目保存到txt中
 for i in dic:
  f.write(str(i)+'\n') 
print("Success！")

以上就是python 爬虫基本使用——统计杭电oj题目正确率并排序的详细内容，更多关于python 爬虫的资料请关注其它相关文章！

python,爬虫,python,统计题目正确率

快活林资源网 Design By www.csstdc.com

广告合作：本站广告合作请联系QQ：858582 申请时备注：广告合作（否则不回）
免责声明：本站资源来自互联网收集,仅供用于学习和交流,请遵循相关法律法规,本站一切资源不代表本站立场,如有侵权、后门、不妥请联系本站删除！

快活林资源网 Design By www.csstdc.com

评论“python 爬虫基本使用——统计杭电oj题目正确率并排序”

暂无评论...

www.csstdc.com 快活林资源网

120,135影音资源

344,641技术资源

22,817软件资源

435,032站长资源

最新文章

《三国志8重置版》劝降机制介绍

2024/12/24

《欢欣森活》最新官方配置要求一览

2024/12/24

《欢欣森活》存档方法

2024/12/24

《炉石传说》2024新赛季上线更新内容问题汇

2024/12/24

《南瓜恐慌》进不去游戏解决方法

2024/12/24

《战舰世界》语音包文件夹位置介绍

2024/12/24

一句话新闻

一口气升级7个大模型SaaS应用，百度智能云：突出一个“开箱即用” - 2024/12/24

这一波大模型产业落地浪潮里，不少企业其实处在 “干瞪眼“的状态。

一种情况是，很多大模型产品看得见却摸不着，在台上一个个遥遥领先——今天Sora技精四座，明天英伟达的机器人又赢得满堂彩，可是到了台下一问：啥时候能用上啊？答曰：遥遥无期。

另一种情况是，企业想用上大模型，却又难免瞻前顾后——既要考虑场景融合，又得兼顾安全性，还要考虑打通现有系统，再加上各种部署成本和繁琐的采购流程……最后只能拂袖：罢了，再等等吧。

稳了！魔兽国服回归的3条重磅消息！官宣时间再确认！

昨天有一位朋友在大神群里分享，自己亚服账号被封号之后居然弹出了国服的封号信息对话框。

这里面让他访问的是一个国服的战网网址，com.cn和后面的zh都非常明白地表明这就是国服战网。
而他在复制这个网址并且进行登录之后，确实是网易的网址，也就是我们熟悉的停服之后国服发布的暴雪游戏产品运营到期开放退款的说明。这是一件比较奇怪的事情，因为以前都没有出现这样的情况，现在突然提示跳转到国服战网的网址，是不是说明了简体中文客户端已经开始进行更新了呢？

更新日志

2024年12月24日

python 爬虫基本使用——统计杭电oj题目正确率并排序

基于python实现坦克大战游戏

Django xadmin安装及使用详解

评论“python 爬虫基本使用——统计杭电oj题目正确率并排序”

稳了！魔兽国服回归的3条重磅消息！官宣时间再确认！

更新日志

友情链接