java基于URL网络编程--获取网页HTML
JAVA URL编程 步骤 创建一个URL。 获取URLConnection对象。 在URLConnection上设置输出功能。 从连接获取输入或输出流。 读取输入流或写入输出流。 关闭输入流或输出流。 具体步骤创建一个URLURL在程序中的表示在Java中定义了一个URL类,该类可以封装URL信息,创建一个URL对象。 1 URL构造办法常用的传一个网址 12URL(String spec)//从 String表示形成一个 URL对象。 1URL myURL = new URL("http://example.com/"); 还有根据协议,端口等等进行创建的。 使用URL对象创建完成URL对象后,可以像使用普通的类对象一样去调用URL类的各种方法 12String getHost( )//返回URL的主机名 12int getPort( )//返回URL的端口号, 如果没有设置端口号返回值为-1)。 12String getFile( )//返回URL的文件名及路径。 12String getRef( )//返回URL的标记 等等 获取URLCo...
挑战程序设计竞赛---poj2431(贪心+优先队列)
贪心,优先队列 题目链接:http://poj.org/problem?id=2431 题目大意: 一辆卡车,初始时,距离终点L,油量为P,在起点到终点途中有n个加油站,每个加油站油量有限,而卡车的油箱容量无限,卡车在行车途中,每走一个单位的距离消耗一个单位的油量,给定n个加油站距离终点的距离以及油存储量。问卡车是否能到达终点,如果可达,最少需要加多少次油,否则输出-1. 题目思路: 采用贪心的思想,卡车当然在不加油的情况下走的越远越好了,而当它没油时,我们再判断卡车在经过的途中的加油站,哪个加油站加的油最多,选油量最多的,这样后面加油次数也越少,然后又继续行驶,当它又没油了的时候,继续选它从起点到该点所经过的加油站油量最多的加油。 做法先将加油站到终点的距离由远到近排下序,这样离起点就是由近到远。就是每经过一个加油站就将该加油站的油量压入优先队列中,然后每次没油的时候,去队首元素加油即可。 参考:https://www.cnblogs.com/zjl192628928/p/9414201.html 为什么这样做呢,经过加油站后还可以加油?其实不是这样的,只是预先模拟汽车到达那...
MOOC学习python爬虫之中国大学排名
定向爬虫 功能描述 还得确定排名信息是不是写在HTML里面 程序设计 实例代码 123456789101112131415161718192021222324252627282930313233import requestsfrom bs4 import BeautifulSoupimport bs4def getHTMLTest(url): try: r = requests.get(url) r.raise_for_status() r.encoding = r.apparent_encoding return r.text except: return ""def fillUnivList(ulist, html): soup = BeautifulSoup(html, "html.parser") for tr in soup.find('tbody').children: if isinstance(...
MOOC学习python爬虫之beautifulsoup
beautifulsoup4 安装12pip3 install beautifulsoup4#python 3.6 deepin15.7 bs4理解以及引用 bs类基本元素 Name属性 Attribus属性 NavigableString属性 Comment属性 总结 HTML基本格式以及遍历 下行遍历 上行遍历 平行遍历 迭代类型:只能放在循环里面 pretiffy()美化代码 find_all name attrs recursive string 拓展办法
MOOC学习python爬虫之简单实战
简单抓取京东,亚马逊,搜索引擎信息,ip归属地查询 京东无意外,status_code返回202 天猫status_code返回503。模拟一波head 搜索引擎 google: 1https://www.google.com/search?q=keyword 爬取网页图片并且保存 IP地址归属地自动查询
MOOC学习python爬虫学习之Requests
Python-Requests库 安装12pip3 install requests# python3 deepin15.6 Requests库的7个主要办法 requests.request() 构造一个请求,支撑以下各方法的基础方法 requests.get() 获取HTML网页的主要方法,对应于HTTP的GET requests.head() 获取HTML网页头信息的方法,对应于HTTP的HEAD requests.post() 向HTML网页提交POST请求的方法,对应于HTTP的POST requests.put() 向HTML网页提交PUT请求的方法,对应于HTTP的PUT requests.patch() 向HTML网页提交局部修改请求,对应于HTTP的PATCH requests.delete() 向HTML页面提交删除请求,对应于HTTP的DELETE request.get() requests.head() HEAD获取头部信息,没有html主体,故r.text为空‘ requests.post() requ...
MOOC学习python爬虫学习之入门
入门 几个库Requests:自动爬取HTML页面,自动网络请求提交 robots.txt:网络爬虫排除标准 Beautiful Soup:解析HTML页面 Scrapy:爬虫框架 采用Python 3.x系列版本 网络爬虫尺寸
挑战程序设计竞赛---POJ3253切木板
《挑战程序设计竞赛》—贪心法另一例子
挑战程序设计竞赛---区间问题(选择最多的工作量)贪心
《挑战程序设计竞赛》—-贪心
挑战程序设计--- 任意四个数字为定和
《挑战程序设计级竞赛》抽签问题—-任意四个数字为定和 扩展此类题目可看 https://wizardforcel.gitbooks.io/the-art-of-programming-by-july/content/02.03.html