如何利用Java爬取网站数据?
创始人
2024-03-22 11:57:37

1.Jsoup介绍

- 官网文档:https://jsoup.org

- Jsoup 是一款Java 的HTML解析器,可直接解析某个URL地址、HTML文本内容。它提供了一套非常省力的API,可通过DOM,CSS以及类似于jQuery的操作方法来取出和操作数据。

2. Jsoup快速入门

- 获取网页标题

 String url = "https://search.jd.com/Search?keyword=手机&wq=手机&page=1";Document document = Jsoup.connect(url).get();String title = document.select("title").text();System.out.println(title);```

- 运行效果:手机 - 商品搜索 - 京东

3. 网站数据分析

3.1 分析网站的访问地址

- 以京东商城为例,商品分页列表的url地址,需要带如下几个参数,因此,在发送http请求时,需要携带正确的参数。

- URL:https://search.jd.com/Search?keyword=手机&wq=手机&page=1

3.2 分析网站的页面结构

- 通过浏览器的开发者工具,可以分析出页面中我们需要的html结构。


  • 可以看出,我们需要的商品数据,封装在一个id=J_goodsList的div标签中,我们可以方便的通过DOM解析出这块数据。

4. 实战实现过程

- 获取第1页的商品基本数据

public static void main(String[] args) throws Exception {//第1页地址String url = "https://search.jd.com/Search?keyword=手机&wq=手机&page=1";//发送http请求Document document = Jsoup.connect(url).get();//在id=J_goodsList的div下,获取所有带有data-sku属性的li标签Elements lis = document.select("div[id=J_goodsList] li[data-sku]");lis.forEach(li -> {//获取商品skuString sku = li.attr("data-sku");//获取商品nameString name = li.select("div[class='p-name p-name-type-2'] a em").text();//获取商品图片地址String img = li.select("div[class=p-img] a img[data-lazy-img]").attr("data-lazy-img");System.out.println(String.format("%s, %s, %s", sku, name, img));});
}
  • 效果预览

  • 在这里插入图片描述

  • 改造为分页获取

  • `public static void main(String[] args) throws Exception {
    //第N页地址
    String url = “https://search.jd.com/Search?keyword=手机&wq=手机&page=” + i;
    //发送http请求
    Document document = Jsoup.connect(url).get();
    //在id=J_goodsList的div下,获取所有带有data-sku属性的li标签
    Elements lis = document.select(“div[id=J_goodsList] li[data-sku]”);
    lis.forEach(
    li -> {
    //获取商品sku
    String sku = li.attr(“data-sku”);
    //获取商品name
    String name = li.select(“div[class=‘p-name p-name-type-2’] a em”).text();
    //获取商品图片地址
    String img = li.select(“div[class=p-img] a img[data-lazy-img]”).attr(“data-lazy-img”);

              System.out.println(String.format("%s, %s, %s", sku, name, img));}
    

    );
    }`

Java最新课程:

Java零基础视频教程(2022最新Java入门,含斯坦福大学练习题+力扣算法题

Java基础入门:

java零基础自学首Java入门教程(含Java项目和Java真题)

Javaweb核心基础

JavaWeb基础教程,Java web从入门到企业实战完整版

Spring Cloud最全微服务架构

史上最全面的springcloud微服务技术栈

SSM框架教程:

SSM框架教程_Spring+SpringMVC+Maven高级+Spring

SpringBoot2全套视频教程:

SpringBoot2全套视频教程,springboot零基础到项目实战

相关内容

热门资讯

【人事】80后吴捷,任职厦门象... (来源:信德海事)12月16日,厦门象屿股份有限公司第十届董事会第一次会议于2025年12月16日在...
最新或2023(历届)雷雨的到... 摘要:远处的天边时而闪烁着电光,整个天空一明一暗。雷在西边的天空中轰轰隆隆地滚动,声音又沉闷又迟钝,...
最新或2023(历届)收藏瞬间... 太阳像个淘气的野孩子,在夏天,它总是很晚才回家。它时常徘徊在各个大街小巷,此时,它又顽皮地把一抹金色...
最新或2023(历届)热爱祖国... 屈辱、抗争、探索,这就是整个中国现代史。特别是当日本帝国主义的铁蹄肆意践踏中华大地,中华民族到了生死...
最新或2023(历届)母爱无垠... 莫泊桑说:“人生最美的情景出现在我们怀念母亲的时候。”只是因为每个人都沐浴着母亲给予的爱的阳光;只是...