XML

概念

Extensible Markup Language（可扩展标记语言）

可扩展：标签都是自己定义的。如<user>等

由于浏览器的恶意竞争，导致html语法松散（就是不按照语法规则书写，浏览器也能解析出对应的代码），所以w3c组织（万维网联盟）推出xml去替代html，但是效果不太理想，后来用于和properties类型文件类似的用途（存储数据）

功能

存储数据
- 配置文件
- 在网络中传输

XMl和HTML的区别

xml标签都是自定义的，html标签都是预定义
xml的语法严格，html语法松散
xml是存储数据的，html是展示数据的

基本语法

xml文档的后缀名必须为.xml
xml文件中的第一行必须定义为文档的声明
xml文档中有且仅有一个根标签
属性值必须使用括号（单双都可）引起来
标签必须正确关闭
xml标签名称区分大小写

<?xml version='1.0'?>
<users>
    <user id="1">
        <name>zhangsan</name>
        <age>23</age>
        <gender>male</gender>
        <br/>
    </user>
    <user id='2'>
        <name>lisi</name>
        <age>24</age>
        <gender>female</gender>
    </user>
</users>

组成部分

文档声明

格式
1
<?xml 属性列表?>
属性列表
- version：版本号，必须的属性
- encoding：编码方式。告知解析引擎当前文档使用的字符集，默认值：ISO-8859-1
- standalone：是否独立
  - yes：不依赖其他文件
  - no：依赖其他文件

指令（了解）

结合css的

<?xml version="1.0" encoding="utf-8" standalone='no' ?>
<?xml-stylesheet type="text/css" href="a.css" ?>
<users>
    <user id="1">
        <name>张三</name>
        <age>23</age>
        <gender>male</gender>
    </user>
    <user id="2">
        <name>lisi</name>
        <age>24</age>
        <gender>female</gender>
    </user>
</users>

1
2
3

name{    
    color:red
}

属性

id属性值唯一

文本

CDARA区：在该区域中的数据会被原样展示
- 格式：<![CDARA[数据]]>

约束

规定xml文档的书写规则

作为框架的使用者（程序员）
1. 能够在xml中引入约束文档
2. 能够简单的读懂约束文档

分类

DTD(一种简单的约束技术)

内部dtd：将约束规则定义在要使用的xml文档中

外部dtd：将约束的规则定义在外部的dtd文件中，使用时在引入

<!ELEMENT students (student*)>
        <!--
        ELEMENT:元素的意思，去定义标签
        
        ATTLIST:定义了属性
        
        students (student*)：定义了一个students的标签，在这个标签里面可以定义student的子标签，*表是可以出现0次或多次，+表示必须出现一次
        
        student (name,age,sex)：定义了一个student标签，在student标签里面能出现name、age、sex三个标签，而且这三个标签只能按照顺序出现一次
        
        name (#PCDATA)：定义了一个name标签，name标签体中的内容是字符串
        
        ATTLIST student number ID #REQUIRED：给student标签声明了一个属性，属性名叫number，属性的类型是id，表示number这个属性值唯一，并且是必须出现
        -->
<!ELEMENT student (name,age,sex)>
<!ELEMENT name (#PCDATA)>
<!ELEMENT age (#PCDATA)>
<!ELEMENT sex (#PCDATA)>
<!ATTLIST student number ID #REQUIRED>

引入dtd文档到xml

本地

<!--<!DOCTYPE 根标签名 SYSTEM "dtd文件的位置">-->

<? xml version="1.0" encoding="UTF-8"?>
        <!DOCTYPE studnets SYSTEM "student.dtd">
<students>
    <studnet number="1">
        <name>张三</name>
        <age>23</age>
        <sex>male</sex>
    </studnet>
    <studnet number="2">
        <name>Lisi</name>
        <age>24</age>
        <sex>male</sex>
    </studnet>
</students>

网络

1	`<!DOCTYPE 根标签名 PUBLIC "dtd文件名字" "dtd文件的位置URL">`

Schema（一种复杂的约束技术）

该约束文件名后缀为xsd

引入

填写xml文档的根元素
引入xsi前缀，xmlns:xsi=”http://www.w3.org/2001/XMLSchema-instance“
引入xsd文件命名空间，xsi:schemaLocation=”http://www.itcast.cn/xml student.xsd”
为每一个xsd约束声明一个前缀作为标识， xmlns=”http://www.itcast.cn/xml“

<?xml version="1.0"?>
<xsd:schema xmlns="http://www.itcast.cn/xml" xmlns:xsd="http://www.w3.org/2001/XMLSchema"
            targetNamespace="http://www.itcast.cn/xml" elementFormDefault="qualified">
    <xsd:element name="students" type="studentsType"/>
    <xsd:complexType name="studentsType">
        <xsd:sequence>
            <xsd:element name="student" type="studentType" minOccurs="0" maxOccurs="unbounded"/>
        </xsd:sequence>
    </xsd:complexType>
    <xsd:complexType name="studentType">
        <xsd:sequence>
            <xsd:element name="name" type="xsd:string"/>
            <xsd:element name="age" type="ageType"/>
            <xsd:element name="sex" type="sexType"/>
        </xsd:sequence>
        <xsd:attribute name="number" type="numberType" use="required"/>
    </xsd:complexType>
    <xsd:simpleType name="sexType">
        <xsd:restriction base="xsd:string">
            <xsd:enumeration value="male"/>
            <xsd:enumeration value="female"/>
        </xsd:restriction>
    </xsd:simpleType>
    <xsd:simpleType name="ageType">
        <xsd:restriction base="xsd:integer">
            <xsd:minInclusive value="0"/>
            <xsd:maxInclusive value="256"/>
        </xsd:restriction>
    </xsd:simpleType>
    <xsd:simpleType name="numberType">
        <xsd:restriction base="xsd:string">
            <xsd:pattern value="heima_\d{4}"/>
        </xsd:restriction>
    </xsd:simpleType>
</xsd:schema>

<?xml version="1.0" encoding="UTF-8" ?>
<!-- 	1.填写xml文档的根元素 students
        2.引入xsi前缀.  xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
        3.引入xsd文件命名空间.  xsi:schemaLocation="http://www.itcast.cn/xml  student.xsd"
        4.为每一个xsd约束声明一个前缀,作为标识 (这里的a可以为任意字符串,这里的http://www.itcast.cn/xml是dtd中的namespace) xmlns:a="http://www.itcast.cn/xml"
        5.如果引入多个约束，那么就是根据前缀去引入对应xsd文件的标签，比如<context:annotation-config 、<mvc:annotation-driven />、<a:students>等
        6.在引入的多个约束中，其中一个可以不写前缀，使用该xsd文件中的标签也不需要携带前缀
-->
<students xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xmlns="http://www.itcast.cn/xml"
          xsi:schemaLocation="http://www.itcast.cn/xml  student.xsd">
    <student number="0001">
        <name id="userName">tom</name>
        <age>18</age>
        <sex>male</sex>
    </student>
</students>

解析

操作xml文档，将文档中的数据读取到内存中

操作xml文档

解析（读取）:将文档中的数据读取到内存中
写入：将内存中的数据保存到xml文档中，进行持久化存储

解析XMl的方式

DOM

将标记语言文档一次性加载进内存中，在内存中形成一棵dom树

优点：
操作方便，可以对文档进行CRUD的所有操作
缺点：
占内存

SAX

逐行读取，基于事件驱动的

优点：
不占内存
缺点：
只能读取，不能增删改

常见的XML解析器

JAXP
sun公司提供的解析器，支持dom和sax两种思想
DOM4J
一款非常优秀的解析器
Jsoup
一款Java的HTML解析器，可以直接解析某个URL地址、HTML文本内容。它提供一套非常省力的API，可以通过DOM、CSS以及类似于jQuery的操作方法来取出和操作数据
PULL
Android操作系统的解析器，sax方式的

Jsoup

快速入门

步骤：

导入jar包
获取Document对象
获取对应的标签
获取数据

package com.zhuixun.jsoup;

import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;

import java.io.File;
import java.io.IOException;

/**
 * @Author： zhuixun
 * @Date: 2023/5/5 23:12
 * @Version 1.0
 */
public class JsoupDemo1 {
    public static void main(String[] args) throws IOException {
        //2.获取Document对象,根据xml文档获取        
        // 2.1获取student.xml的path 
        String path = JsoupDemo1.class.getClassLoader().getResource("student.xml").getPath();
        //2.2解析xml文档，加载文档进内存，获取dom属性     
        Document document = Jsoup.parse(new File(path), "utf-8");
        //3.获取元素对象 Element对象       
        Elements elements = document.getElementsByTag("name");
        for (Element element : elements) {
            //获取数据         
            System.out.println(element.text());
        }
    }
}

对象的使用

Jsoup

工具类，可以解析html或xml文档，返回Document

parse方法：解析html或xml文档，返回Document
- pares(File in,String charsetName)：解析xml或html文件的
- parse(String html)：解析xml或html字符串
- parse(URL url,timeoutMillis)：通过网络路径获取指定的html或xml文档对象，可以用于爬取网页数据

Documnet

文档对象，代表内存中的dom树

获取Element对象
- getElementById(String id)
  根据id属性值获取唯一的element对象
- getElementsByTag(String tageName)
  根据标签名称获取元素对象集合
- getElementsByAttribute(String key)
  根据属性名称获取元素对象集合
- getElementsByAttributeValue(String key,String value)
  根据对应的属性名和属性值获取元素对象集合

package cn.itcast.xml.jsoup;

import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;

import java.io.File;
import java.io.IOException;
import java.net.URL;

/**
 * Document/Element对象功能
 */
public class JsoupDemo3 {
    public static void main(String[] args) throws IOException {
        //1.获取student.xml的path      
        String path = JsoupDemo3.class.getClassLoader().getResource("student.xml").getPath();
        //2.获取Document对象        
        Document document = Jsoup.parse(new File(path), "utf-8");
        //3.获取元素对象了。        
        // 3.1获取所有student对象     
        Elements elements = document.getElementsByTag("student");
        System.out.println(elements);
        System.out.println("-----------");
        //3.2 获取属性名为id的元素对象们     
        Elements elements1 = document.getElementsByAttribute("id");
        System.out.println(elements1);
        System.out.println("-----------");
        //3.2获取 number属性值为0001的元素对象  
        Elements elements2 = document.getElementsByAttributeValue("number", "0001");
        System.out.println(elements2);
        System.out.println("-----------");
        //3.3获取id属性值的元素对象    
        Element userName = document.getElementById("userName");
        System.out.println(userName);
    }
}

Elements

元素Element对象的集合。可以当做ArrayList< Element>来使用

Element

元素对象，可以获取名称或者值

获取子元素对象
- getElementById(String id)
  根据id属性值获取唯一的element对象
- getElementsByTag(String tagName)
  根据标签名称获取元素对象集合
- getElementsByAttribute(String key)
  根据属性名称获取元素对象集合
- getElementsByAttributeValue(String key,String value)
  根据对应的属性名和属性值获取元素对象集合
获取属性值
- String attr(String key)
  根据属性名称获取属性值
获取文本内容
- String text()
  获取文本内容
- String html()
  获取标签体的所有内容（包括子标签的字符串内容）

package cn.itcast.xml.jsoup;

import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;

import java.io.File;
import java.io.IOException;

/**
 * Element对象功能
 */
public class JsoupDemo4 {
    public static void main(String[] args) throws IOException {
        //1.获取student.xml的path    
        String path = JsoupDemo4.class.getClassLoader().getResource("student.xml").getPath();
        //2.获取Document对象      
        Document document = Jsoup.parse(new File(path), "utf-8");
        //通过Document对象获取name标签，获取所有的name标签，可以获取到两个   
        Elements elements = document.getElementsByTag("name");
        System.out.println(elements.size());
        System.out.println("----------------");
        //通过Element对象获取子标签对象      
        Element element_student = document.getElementsByTag("student").get(0);
        Elements ele_name = element_student.getElementsByTag("name");
        System.out.println(ele_name.size());
        //获取student对象的属性值    
        String number = element_student.attr("NUMBER");
        System.out.println(number);
        System.out.println("------------");
        //获取文本内容       
        String text = ele_name.text();
        String html = ele_name.html();
        System.out.println(text);
        System.out.println(html);
    }
}

Node

节点对象，是Document和Element的父类

快捷查询方式

selector选择器

使用方法
Elements select(String cssQuery)
语法：参考Selector类中定义的语法

package cn.itcast.xml.jsoup;

import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;

import java.io.File;
import java.io.IOException;

/**
 * 选择器查询
 */
public class JsoupDemo5 {
    public static void main(String[] args) throws IOException {
        //1.获取student.xml的path   
        String path = JsoupDemo5.class.getClassLoader().getResource("student.xml").getPath();
        //2.获取Document对象    
        Document document = Jsoup.parse(new File(path), "utf-8");
        //3.查询name标签     
        /* div{ } */
        Elements elements = document.select("name");
        System.out.println(elements);
        System.out.println("=----------------");
        //4.查询id值为userName的元素   
        Elements elements1 = document.select("#userName");
        System.out.println(elements1);
        System.out.println("----------------");
        //5.获取student标签并且number属性值为0001的age子标签        
        // 5.1.获取student标签并且number属性值为0001    
        Elements elements2 = document.select("student[number=\"0001\"]");
        System.out.println(elements2);
        System.out.println("----------------");
        //5.2获取student标签并且number属性值为0001的age子标签 
        Elements elements3 = document.select("student[number=\"0001\"] > age");
        System.out.println(elements3);
    }
}

XPath

XPath即为XML路径语言，它是一种用来确定XML（标准通用标记语言的子集）文档中某部分位置的语言。

使用Jsoup的Xpath需要额外导入jar包。查询w3cshool参考手册，使用xpath的语法完成查询

package cn.itcast.xml.jsoup;

import cn.wanghaomiao.xpath.exception.XpathSyntaxErrorException;
import cn.wanghaomiao.xpath.model.JXDocument;
import cn.wanghaomiao.xpath.model.JXNode;
import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.select.Elements;

import java.io.File;
import java.io.IOException;
import java.util.List;

/**
 * XPath查询
 */
public class JsoupDemo6 {
    public static void main(String[] args) throws IOException, XpathSyntaxErrorException {
        //1.获取student.xml的path     
        String path = JsoupDemo6.class.getClassLoader().getResource("student.xml").getPath();
        //2.获取Document对象      
        Document document = Jsoup.parse(new File(path), "utf-8");
        //3.根据document对象，创建JXDocument对象       
        JXDocument jxDocument = new JXDocument(document);
        //4.结合xpath语法查询        
        // 4.1查询所有student标签    
        List<JXNode> jxNodes = jxDocument.selN("//student");
        for (JXNode jxNode : jxNodes) {
            System.out.println(jxNode);
        }
        System.out.println("--------------------");
        //4.2查询所有student标签下的name标签   
        List<JXNode> jxNodes2 = jxDocument.selN("//student/name");
        for (JXNode jxNode : jxNodes2) {
            System.out.println(jxNode);
        }
        System.out.println("--------------------");
        //4.3查询student标签下带有id属性的name标签    
        List<JXNode> jxNodes3 = jxDocument.selN("//student/name[@id]");
        for (JXNode jxNode : jxNodes3) {
            System.out.println(jxNode);
        }
        System.out.println("--------------------");
        //4.4查询student标签下带有id属性的name标签 并且id属性值为userName  
        List<JXNode> jxNodes4 = jxDocument.selN("//student/name[@id='userName']");
        for (JXNode jxNode : jxNodes4) {
            System.out.println(jxNode);
        }
    }
}

JavaWeb

#XML

XML

http://example.com/2023/05/06/JavaWeb/XML/

作者

zhuixun

发布于

2023年5月6日

许可协议

Tomcat&Servlet 上一篇

Bootstrap 下一篇