htmlTree

Проанализированное HTML-дерево

Описание

Один htmlTree объект представляет проанализированный элемент или узел HTML. Извлеките интересующие части с помощью findElement функции или Children и извлечь текст с помощью extractHTMLText функция.

Создание

Синтаксис

tree = startTree (код)

Описание

пример

tree = htmlTree(code) анализирует HTML-код в строке code и возвращает результирующую древовидную структуру.

Входные аргументы

развернуть все

`code` - HTML-код
строковый массив | символьный вектор | клеточный массив символьных векторов

HTML-код, заданный как строковый массив, символьный вектор или массив ячеек символьных векторов.

Совет

Чтобы прочитать HTML-код с веб-страницы, используйте webread.
Для извлечения текста из HTML-файла используйте extractFileText.

Пример: "<a href='https://www.mathworks.com'>MathWorks</a>"

Типы данных: char | string | cell

Свойства

развернуть все

`Children` - Прямые потомки элемента
`htmlTree` множество

Прямые потомки элемента, указанные как htmlTree массив.

`Parent` - Родительский узел
`htmlTree` объект

Родительский узел в дереве, указанный как htmlTree объект.

Если дерево HTML является корневым узлом, то значение Parent является missing.

`Name` - имя элемента HTML
строковый скаляр

Имя элемента HTML, указанное как строковый скаляр.

Дополнительные сведения см. в разделе Элементы HTML.

Функции объекта

`findElement`	Поиск элементов в дереве HTML
`getAttribute`	Считывание атрибута HTML корневого узла дерева HTML
`extractHTMLText`	Извлечение текста из HTML
`ismissing`	Поиск HTML-деревьев без значений

Примеры

свернуть все

Анализ кода HTML

Открыть сценарий в реальном времени

Считывание HTML-кода с URL-адреса https://www.mathworks.com/help/textanalytics использование webread.

url = "https://www.mathworks.com/help/textanalytics";
code = webread(url);

Анализ кода HTML с помощью htmlTree.

tree = htmlTree(code);

Просмотр имени элемента корневого узла дерева.

tree.Name

ans = 
"HTML"

Просмотр нижестоящих элементов корневого узла.

tree.Children

ans = 
  4×1 htmlTree:

    " "
    <HEAD><TITLE>Text Analytics Toolbox Documentation</TITLE><META charset="utf-8"/><META content="width=device-width, initial-scale=1.0" name="viewport"/><META content="IE=edge" http-equiv="X-UA-Compatible"/><LINK href="/includes_content/responsive/css/bootstrap/bootstrap.min.css" rel="stylesheet" type="text/css"/><LINK href="/includes_content/responsive/css/site6.css?201903" rel="stylesheet" type="text/css"/><LINK href="/includes_content/responsive/css/site6_lg.css?201903" media="screen and (min-width: 1200px)" rel="stylesheet"/><LINK href="/includes_content/responsive/css/site6_md.css?201903" media="screen and (min-width: 992px) and (max-width: 1199px)" rel="stylesheet"/><LINK href="/includes_content/responsive/css/site6_sm+xs.css?201903" media="screen and (max-width: 991px)" rel="stylesheet"/><LINK href="/includes_content/responsive/css/site6_sm.css?201903" media="screen and (min-width: 768px) and (max-width: 991px)" rel="stylesheet"/><LINK href="/includes_content/responsive/css/site6_…
    " "
    <BODY id="responsive_offcanvas"><!-- Mobile TopNav: Start --><DIV class="header visible-xs visible-sm" id="header_mobile" translate="no"><NAV class="navbar navbar-default" role="navigation"><DIV class="container-fluid"><DIV class="row"><DIV class="col-xs-12"><DIV class="navbar-header"><BUTTON class="navbar-toggle topnav_toggle" data-target="#topnav_collapse" data-toggle="collapse" type="button"><SPAN class="sr-only">Toggle Main Navigation</SPAN><SPAN class="icon-menu"/></BUTTON><A class="svg_link navbar-brand" href="https://www.mathworks.com?s_tid=gn_logo"><IMG alt="MathWorks" class="mw_logo" src="/images/responsive/global/pic-header-mathworks-logo.svg"/></A></DIV></DIV></DIV><DIV class="row visible-xs visible-sm"><DIV class="col-xs-12"><DIV class="navbar-collapse collapse" id="topnav_collapse"><UL class="nav navbar-nav" id="topnav"><LI class="headernav_login"><A class="mwa-nav_login" href="https://www.mathworks.com/login?uri=http://www.mathworks.com/help/textanalytics/index.html">Sign…

Извлечение текста из дерева HTML с помощью extractHTMLText.

str = extractHTMLText(tree)

str = 
    "Text Analytics Toolbox™ provides algorithms and visualizations for preprocessing, analyzing, and modeling text data. Models created with the toolbox can be used in applications such as sentiment analysis, predictive maintenance, and topic modeling.
     
     Text Analytics Toolbox includes tools for processing raw text from sources such as equipment logs, news feeds, surveys, operator reports, and social media. You can extract text from popular file formats, preprocess raw text, extract individual words, convert text into numerical representations, and build statistical models.
     
     Using machine learning techniques such as LSA, LDA, and word embeddings, you can find clusters and create features from high-dimensional text datasets. Features created with Text Analytics Toolbox can be combined with features from other data sources to build machine learning models that take advantage of textual, numeric, and other types of data."

Поиск элементов в дереве HTML

Открыть сценарий в реальном времени

Считывание HTML-кода с URL-адреса https://www.mathworks.com/help/textanalytics с использованием webread функция.

url = "https://www.mathworks.com/help/textanalytics";
code = webread(url);

Анализ кода HTML с помощью htmlTree.

tree = htmlTree(code);

Поиск всех гиперссылок в дереве HTML с помощью findElement. Гиперссылки представляют собой узлы с именем элемента "A".

selector = "A";
subtrees = findElement(tree,selector);

Просмотрите первые несколько поддеревьев.

subtrees(1:10)

ans = 
  10×1 htmlTree:

    <A class="skip_link sr-only" href="#content_container">Skip to content</A>
    <A href="https://www.mathworks.com?s_tid=gn_logo" class="svg_link navbar-brand"><IMG src="/images/responsive/global/pic-header-mathworks-logo.svg" class="mw_logo" alt="MathWorks"/></A>
    <A href="https://www.mathworks.com/products.html?s_tid=gn_ps">Products</A>
    <A href="https://www.mathworks.com/solutions.html?s_tid=gn_sol">Solutions</A>
    <A href="https://www.mathworks.com/academia.html?s_tid=gn_acad">Academia</A>
    <A href="https://www.mathworks.com/support.html?s_tid=gn_supp">Support</A>
    <A href="https://www.mathworks.com/matlabcentral/?s_tid=gn_mlc">Community</A>
    <A href="https://www.mathworks.com/company/events.html?s_tid=gn_ev">Events</A>
    <A href="https://www.mathworks.com/products/get-matlab.html?s_tid=gn_getml">Get MATLAB</A>
    <A href="https://www.mathworks.com?s_tid=gn_logo" class="svg_link pull-left"><IMG src="/images/responsive/global/pic-header-mathworks-logo.svg" class="mw_logo" alt="MathWorks"/></A>

Извлечение текста из поддеревьев с помощью extractHTMLText. Результат содержит текст ссылки из каждой ссылки на странице.

str = extractHTMLText(subtrees);
str(1:10)

ans = 10×1 string
    "Skip to content"
    ""
    "Products"
    "Solutions"
    "Academia"
    "Support"
    "Community"
    "Events"
    "Get MATLAB"
    ""

Получить атрибут тега HTML

Открыть сценарий в реальном времени

Считывание HTML-кода с URL-адреса https://www.mathworks.com/help/textanalytics использование webread.

url = "https://www.mathworks.com/help/textanalytics";
code = webread(url);

Анализ кода HTML с помощью htmlTree.

tree = htmlTree(code);

Поиск всех гиперссылок в дереве HTML с помощью findElement. Гиперссылки - это узлы с именем элемента "A".

selector = "A";
subtrees = findElement(tree,selector);
subtrees(1:10)

ans = 
  10×1 htmlTree:

    <A class="svg_link navbar-brand" href="https://www.mathworks.com?s_tid=gn_logo"><IMG alt="MathWorks" class="mw_logo" src="/images/responsive/global/pic-header-mathworks-logo.svg"/></A>
    <A class="mwa-nav_login" href="https://www.mathworks.com/login?uri=http://www.mathworks.com/help/textanalytics/index.html">Sign In</A>
    <A href="https://www.mathworks.com/products.html?s_tid=gn_ps">Products</A>
    <A href="https://www.mathworks.com/solutions.html?s_tid=gn_sol">Solutions</A>
    <A href="https://www.mathworks.com/academia.html?s_tid=gn_acad">Academia</A>
    <A href="https://www.mathworks.com/support.html?s_tid=gn_supp">Support</A>
    <A href="https://www.mathworks.com/matlabcentral/?s_tid=gn_mlc">Community</A>
    <A href="https://www.mathworks.com/company/events.html?s_tid=gn_ev">Events</A>
    <A href="https://www.mathworks.com/company/aboutus/contact_us.html?s_tid=gn_cntus">Contact Us</A>
    <A href="https://www.mathworks.com/store?s_cid=store_top_nav&amp;s_tid=gn_store">How to Buy</A>

Получение ссылок на гиперссылки с помощью getAttribute. Укажите имя атрибута "href".

attr = "href";
str = getAttribute(subtrees,attr);
str(1:10)

ans = 10×1 string array
    "https://www.mathworks.com?s_tid=gn_logo"
    "https://www.mathworks.com/login?uri=http://www.mathworks.com/help/textanalytics/index.html"
    "https://www.mathworks.com/products.html?s_tid=gn_ps"
    "https://www.mathworks.com/solutions.html?s_tid=gn_sol"
    "https://www.mathworks.com/academia.html?s_tid=gn_acad"
    "https://www.mathworks.com/support.html?s_tid=gn_supp"
    "https://www.mathworks.com/matlabcentral/?s_tid=gn_mlc"
    "https://www.mathworks.com/company/events.html?s_tid=gn_ev"
    "https://www.mathworks.com/company/aboutus/contact_us.html?s_tid=gn_cntus"
    "https://www.mathworks.com/store?s_cid=store_top_nav&s_tid=gn_store"

Преобразовать проанализированный HTML-код в строку

Открыть сценарий в реальном времени

Считывание HTML-кода с URL-адреса https://www.mathworks.com/help/textanalytics с использованием webread функция.

url = "https://www.mathworks.com/help/textanalytics";
code = webread(url);

Разбор кода HTML с помощью htmlTree функция.

tree = htmlTree(code);

Поиск всех абзацев в дереве HTML с помощью findElement функция. Абзацы представляют собой узлы с именем элемента «P».

subtrees = findElement(tree,"P");

Преобразование поддеревьев в строку с помощью string функция.

str = string(subtrees)

str = 26×1 string
    "<P class="h1">↵  <A href="../index.html" class="coming_from_product">Documentation</A>↵  <A href="../index.html" class="not_coming_from_product">Help Center</A>↵</P>"
    "<P>Text Analytics Toolbox™ provides algorithms and visualizations for preprocessing, analyzing, and modeling text data. Models created with the toolbox can be used in applications such as sentiment analysis, predictive maintenance, and topic modeling.</P>"
    "<P>Text Analytics Toolbox includes tools for processing raw text from sources such as equipment logs, news feeds, surveys, operator reports, and social media. You can extract text from popular file formats, preprocess raw text, extract individual words, convert text into numerical representations, and build statistical models.</P>"
    "<P>Using machine learning techniques such as LSA, LDA, and word embeddings, you can find clusters and create features from high-dimensional text datasets. Features created with Text Analytics Toolbox can be combined with features from other data sources to build machine learning models that take advantage of textual, numeric, and other types of data.</P>"
    "<P class="category_desc">Learn the basics of Text Analytics Toolbox</P>"
    "<P class="category_desc">Import text data into MATLAB<SUP>®</SUP> and preprocess it for analysis</P>"
    "<P class="category_desc">Develop predictive models using topic models and word embeddings</P>"
    "<P class="category_desc">Visualize text data and models using word clouds and text scatter plots</P>"
    "<P class="category_desc">Information on language support in Text Analytics Toolbox</P>"
    "<P>You clicked a link that corresponds to this MATLAB command:</P>"
    "<P>Run the command by entering it in the MATLAB Command Window. Web browsers do not support MATLAB commands.</P>"
    "<P>Choose a web site to get translated content where available and see local events and offers. Based on your location, we recommend that you select: <STRONG class="recommended-country"/>.</P>"
    "<P>You can also select a web site from the following list:</P>"
    "<P>Select the China site (in Chinese or English) for best site performance. Other MathWorks country sites are not optimized for visits from your location.</P>"
    "<P class="text-center">↵  <A href="#" class="worldwide_link">Contact your local office</A>↵</P>"
    "<P class="ff_section_title">Explore Products</P>"
    "<P class="ff_section_title">Try or Buy</P>"
    "<P class="ff_section_title">Learn to Use</P>"
    "<P class="ff_section_title">Get Support</P>"
    "<P class="ff_section_title">About <SPAN translate="no">MathWorks</SPAN></P>"
    "<P class="h4 add_font_futura_medium add_margin_0">↵  <SPAN translate="no">MathWorks</SPAN>↵</P>"
    "<P>↵  <EM>Accelerating the pace of engineering and science</EM>↵</P>"
    "<P><SPAN translate="no">MathWorks</SPAN> is the leading developer of mathematical computing software for engineers and scientists.</P>"
    "<P>↵  <A href="/discovery.html?s_tid=all_disc_mw_ff">Discover...</A>↵</P>"
    "<P class="copyright" translate="no">© 1994-2021 The MathWorks, Inc.</P>"
    "<P>↵  <EM>Join the conversation</EM>↵</P>"

Подробнее

развернуть все

Элементы HTML

Типичный элемент HTML содержит следующие компоненты:

Имя элемента - имя HTML-тега. Имя элемента соответствует Name свойства HTML-дерева.
Атрибуты (Attributes) - дополнительная информация о теге. Атрибуты HTML имеют форму name="value", где name и value обозначают имя атрибута и значение соответственно. Атрибуты отображаются в открывающемся теге HTML. Чтобы получить значения атрибутов из HTML-дерева, используйте getAttribute.
Содержимое - содержимое элемента. Содержимое отображается между открывающими и закрывающими тегами HTML. Содержимое может представлять собой текстовые данные или вложенные элементы HTML. Извлечение текста из htmlTree объект, использование extractHTMLText. Получение вложенных элементов HTML htmlTree объект, используйте Children собственность.

Например, элемент HTML <a href="https://www.mathworks.com">Home</a> содержит:

Компонент		Стоимость	Описание
Имя элемента		`a`	Элемент является гиперссылкой
Признак	Наименование атрибута	`href`	Ссылка на гиперссылку
Признак	Значение атрибута	`"https://www.mathworks.com"`	Ссылочное значение гиперссылки
Содержание		`Home`	Текст для отображения

Вопросы совместимости

развернуть все

`htmlTree` использует другой алгоритм для реструктуризации неверно сформированного HTML

В R2021a изменилось поведение

При создании htmlTree объект, программное обеспечение автоматически реструктурирует неправильно сформированный входной HTML-код, чтобы иметь допустимую структуру. Этот процесс реструктуризации включает добавление, удаление и редактирование элементов, а также изменение структуры дерева. Начиная с R2021a, программное обеспечение использует обновленный алгоритм для реструктуризации неверно сформированного HTML. Это изменение может привести к htmlTree объекты, созданные в R2021a или более поздних версиях, имеющие другие размеры, структуру и содержимое по сравнению с предыдущими версиями.

Начиная с R2021a, при загрузке htmlTree объекты из файлов MAT, созданных в R2020b или ранее, программа автоматически реструктуризирует htmlTree объект, использующий тот же алгоритм, что и при создании htmlTree объекты. При загрузке htmlTree объекты из файлов MAT, созданных в R2021a или более поздних версиях, программа не реструктуризирует htmlTree объект.

В этой таблице освещаются некоторые важные этапы процесса реструктуризации:

Шаг Изменение поведения

Автоматическое добавление элементов заголовка и заголовка.

Шаг	Изменение поведения
Автоматическое добавление элементов заголовка и заголовка.	Начиная с R2021a, при создании `htmlTree` объект из HTML-кода, программное обеспечение автоматически вставляет отсутствующие `<HEAD>`, `<TITLE>`и другие элементы. В предыдущих версиях `htmlTree` объект включал эти элементы только тогда, когда они присутствуют во входном коде. При загрузке `htmlTree` объекты из файлов MAT, созданных в более ранней версии, программа автоматически вставляет `<HEAD>` и `<TITLE>` элементы. При загрузке `htmlTree` объекты из файлов MAT, созданных в R2021a или более поздних версиях, программа не вставляет эти элементы автоматически.
Автоматически добавлять отсутствующие элементы.	Начиная с R2021a, при создании `htmlTree` объект из HTML-кода, программа автоматически вставляет отсутствующие элементы, когда родительские и дочерние элементы противоречивы. Например, когда `<li>` (элемент списка) не имеет родительского элемента `<ul>` (неупорядоченный список) или `<ol>` (неупорядоченный список), программное обеспечение автоматически добавляет `<ul>` чтобы сделать HTML допустимым. Это может привести к различным выходам по сравнению с предыдущими версиями. При загрузке `htmlTree` объекты из файлов MAT, созданных в более ранней версии, программа автоматически вставляет отсутствующие элементы. При загрузке `htmlTree` объекты из файлов MAT, созданных в R2021a или более поздних версиях, программа не вставляет отсутствующие элементы автоматически.
Удалить части неправильно сформированного кода.	При создании `htmlTree` объект с неправильным HTML-кодом, программа может отбросить части текста. Например, если входной код является строкой `"<div>a</"`, то программное обеспечение отбрасывает текст `"a</"`.

Начиная с R2021a, при создании htmlTree объект из HTML-кода, программное обеспечение автоматически вставляет отсутствующие <HEAD>, <TITLE>и другие элементы. В предыдущих версиях htmlTree объект включал эти элементы только тогда, когда они присутствуют во входном коде.

При загрузке htmlTree объекты из файлов MAT, созданных в более ранней версии, программа автоматически вставляет <HEAD> и <TITLE> элементы. При загрузке htmlTree объекты из файлов MAT, созданных в R2021a или более поздних версиях, программа не вставляет эти элементы автоматически.

Автоматически добавлять отсутствующие элементы.

Начиная с R2021a, при создании htmlTree объект из HTML-кода, программа автоматически вставляет отсутствующие элементы, когда родительские и дочерние элементы противоречивы. Например, когда <li> (элемент списка) не имеет родительского элемента <ul> (неупорядоченный список) или <ol> (неупорядоченный список), программное обеспечение автоматически добавляет <ul> чтобы сделать HTML допустимым. Это может привести к различным выходам по сравнению с предыдущими версиями.

При загрузке htmlTree объекты из файлов MAT, созданных в более ранней версии, программа автоматически вставляет отсутствующие элементы. При загрузке htmlTree объекты из файлов MAT, созданных в R2021a или более поздних версиях, программа не вставляет отсутствующие элементы автоматически.

Удалить части неправильно сформированного кода.

При создании htmlTree объект с неправильным HTML-кодом, программа может отбросить части текста. Например, если входной код является строкой "<div>a</", то программное обеспечение отбрасывает текст "a</".

См. также

Темы

Представлен в R2018b

Документация

htmlTree

Описание

Создание

Синтаксис

Описание

Входные аргументы

`code` - HTML-код
строковый массив | символьный вектор | клеточный массив символьных векторов

Свойства

`Children` - Прямые потомки элемента
`htmlTree` множество

`Parent` - Родительский узел
`htmlTree` объект

`Name` - имя элемента HTML
строковый скаляр

Функции объекта

Примеры

Анализ кода HTML

Поиск элементов в дереве HTML

Получить атрибут тега HTML

Преобразовать проанализированный HTML-код в строку

Подробнее

Элементы HTML

Вопросы совместимости

`htmlTree` использует другой алгоритм для реструктуризации неверно сформированного HTML

См. также

Темы

Документация по инструментам для анализа текста

Поддержка

Документация

htmlTree

Описание

Создание

Синтаксис

Описание

Входные аргументы

code - HTML-код строковый массив | символьный вектор | клеточный массив символьных векторов

Свойства

Children - Прямые потомки элемента htmlTree множество

Parent - Родительский узел htmlTree объект

Name - имя элемента HTML строковый скаляр

Функции объекта

Примеры

Анализ кода HTML

Поиск элементов в дереве HTML

Получить атрибут тега HTML

Преобразовать проанализированный HTML-код в строку

Подробнее

Элементы HTML

Вопросы совместимости

htmlTree использует другой алгоритм для реструктуризации неверно сформированного HTML

См. также

Темы

Документация по инструментам для анализа текста

Поддержка

`code` - HTML-код
строковый массив | символьный вектор | клеточный массив символьных векторов

`Children` - Прямые потомки элемента
`htmlTree` множество

`Parent` - Родительский узел
`htmlTree` объект

`Name` - имя элемента HTML
строковый скаляр

`htmlTree` использует другой алгоритм для реструктуризации неверно сформированного HTML