htmlTree

Синтаксический HTML

Описание

Система координат htmlTree объект представляет проанализированный HTML элемента или узел. Извлечение интересующих частей с помощью findElement функцию или Children свойство и извлечение текста с помощью extractHTMLText функция.

Создание

Синтаксис

tree = htmlTree(code)

Описание

пример

tree = htmlTree(code) анализирует HTML кода в строке code и возвращает получившуюся древовидную структуру.

Входные параметры

расширить все

`code` - HTML
массив строк | символьный вектор | ячеек из символьных векторов

HTML кода, заданная как строковые массивы, вектор символов или массив ячеек векторов символов.

Совет

Чтобы считать HTML кода с веб-страницы, используйте webread.
Чтобы извлечь текст из HTML файла, используйте extractFileText.

Пример: "<a href='https://www.mathworks.com'>MathWorks</a>"

Типы данных: char | string | cell

Свойства

расширить все

`Children` - Прямые потомки элемента
`htmlTree` массив

Прямые потомки элемента, заданные как htmlTree массив.

`Parent` - Родительский узел
`htmlTree` объект

Родительский узел в дереве, заданный как htmlTree объект.

Если HTML является корневым узлом, то значение Parent является missing.

`Name` - имя элемента HTML
строковый скаляр

Имя элемента HTML, заданное как строковый скаляр.

Для получения дополнительной информации см. раздел Элементы HTML.

Функции объекта

`findElement`	Поиск элементов в HTML
`getAttribute`	Чтение HTML корневого узла HTML
`extractHTMLText`	Извлечение текста из HTML
`ismissing`	Поиск HTML без значений

Примеры

свернуть все

Синтаксический анализ кода HTML

Открыть Live Script

Чтение HTML кода из URL- https://www.mathworks.com/help/textanalytics использование webread.

url = "https://www.mathworks.com/help/textanalytics";
code = webread(url);

Проанализируйте HTML кода с помощью htmlTree.

tree = htmlTree(code);

Просмотрите имя элемента корневого узла дерева.

tree.Name

ans = 
"HTML"

Просмотрите дочерние элементы корневого узла.

tree.Children

ans = 
  4×1 htmlTree:

    " "
    <HEAD><TITLE>Text Analytics Toolbox Documentation</TITLE><META charset="utf-8"/><META content="width=device-width, initial-scale=1.0" name="viewport"/><META content="IE=edge" http-equiv="X-UA-Compatible"/><LINK href="/includes_content/responsive/css/bootstrap/bootstrap.min.css" rel="stylesheet" type="text/css"/><LINK href="/includes_content/responsive/css/site6.css?201903" rel="stylesheet" type="text/css"/><LINK href="/includes_content/responsive/css/site6_lg.css?201903" media="screen and (min-width: 1200px)" rel="stylesheet"/><LINK href="/includes_content/responsive/css/site6_md.css?201903" media="screen and (min-width: 992px) and (max-width: 1199px)" rel="stylesheet"/><LINK href="/includes_content/responsive/css/site6_sm+xs.css?201903" media="screen and (max-width: 991px)" rel="stylesheet"/><LINK href="/includes_content/responsive/css/site6_sm.css?201903" media="screen and (min-width: 768px) and (max-width: 991px)" rel="stylesheet"/><LINK href="/includes_content/responsive/css/site6_…
    " "
    <BODY id="responsive_offcanvas"><!-- Mobile TopNav: Start --><DIV class="header visible-xs visible-sm" id="header_mobile" translate="no"><NAV class="navbar navbar-default" role="navigation"><DIV class="container-fluid"><DIV class="row"><DIV class="col-xs-12"><DIV class="navbar-header"><BUTTON class="navbar-toggle topnav_toggle" data-target="#topnav_collapse" data-toggle="collapse" type="button"><SPAN class="sr-only">Toggle Main Navigation</SPAN><SPAN class="icon-menu"/></BUTTON><A class="svg_link navbar-brand" href="https://www.mathworks.com?s_tid=gn_logo"><IMG alt="MathWorks" class="mw_logo" src="/images/responsive/global/pic-header-mathworks-logo.svg"/></A></DIV></DIV></DIV><DIV class="row visible-xs visible-sm"><DIV class="col-xs-12"><DIV class="navbar-collapse collapse" id="topnav_collapse"><UL class="nav navbar-nav" id="topnav"><LI class="headernav_login"><A class="mwa-nav_login" href="https://www.mathworks.com/login?uri=http://www.mathworks.com/help/textanalytics/index.html">Sign…

Извлечение текста из HTML с помощью extractHTMLText.

str = extractHTMLText(tree)

str = 
    "Text Analytics Toolbox™ provides algorithms and visualizations for preprocessing, analyzing, and modeling text data. Models created with the toolbox can be used in applications such as sentiment analysis, predictive maintenance, and topic modeling.
     
     Text Analytics Toolbox includes tools for processing raw text from sources such as equipment logs, news feeds, surveys, operator reports, and social media. You can extract text from popular file formats, preprocess raw text, extract individual words, convert text into numerical representations, and build statistical models.
     
     Using machine learning techniques such as LSA, LDA, and word embeddings, you can find clusters and create features from high-dimensional text datasets. Features created with Text Analytics Toolbox can be combined with features from other data sources to build machine learning models that take advantage of textual, numeric, and other types of data."

Поиск элементов в HTML

Открыть Live Script

Чтение HTML кода из URL- https://www.mathworks.com/help/textanalytics использование webread функция.

url = "https://www.mathworks.com/help/textanalytics";
code = webread(url);

Проанализируйте HTML кода с помощью htmlTree.

tree = htmlTree(code);

Найти все гиперссылки в HTML можно используя findElement. Гиперссылки являются узлами с именем элемента "A".

selector = "A";
subtrees = findElement(tree,selector);

Просмотрите первые несколько поддеревьев.

subtrees(1:10)

ans = 
  10×1 htmlTree:

    <A class="skip_link sr-only" href="#content_container">Skip to content</A>
    <A href="https://www.mathworks.com?s_tid=gn_logo" class="svg_link navbar-brand"><IMG src="/images/responsive/global/pic-header-mathworks-logo.svg" class="mw_logo" alt="MathWorks"/></A>
    <A href="https://www.mathworks.com/products.html?s_tid=gn_ps">Products</A>
    <A href="https://www.mathworks.com/solutions.html?s_tid=gn_sol">Solutions</A>
    <A href="https://www.mathworks.com/academia.html?s_tid=gn_acad">Academia</A>
    <A href="https://www.mathworks.com/support.html?s_tid=gn_supp">Support</A>
    <A href="https://www.mathworks.com/matlabcentral/?s_tid=gn_mlc">Community</A>
    <A href="https://www.mathworks.com/company/events.html?s_tid=gn_ev">Events</A>
    <A href="https://www.mathworks.com/products/get-matlab.html?s_tid=gn_getml">Get MATLAB</A>
    <A href="https://www.mathworks.com?s_tid=gn_logo" class="svg_link pull-left"><IMG src="/images/responsive/global/pic-header-mathworks-logo.svg" class="mw_logo" alt="MathWorks"/></A>

Извлечь текст из поддеревьев можно используя extractHTMLText. Результат содержит текст ссылки из каждой ссылки на странице.

str = extractHTMLText(subtrees);
str(1:10)

ans = 10×1 string
    "Skip to content"
    ""
    "Products"
    "Solutions"
    "Academia"
    "Support"
    "Community"
    "Events"
    "Get MATLAB"
    ""

Получение атрибута HTML

Открыть Live Script

Чтение HTML кода из URL- https://www.mathworks.com/help/textanalytics использование webread.

url = "https://www.mathworks.com/help/textanalytics";
code = webread(url);

Проанализируйте HTML кода с помощью htmlTree.

tree = htmlTree(code);

Найти все гиперссылки в HTML можно используя findElement. Гиперссылки являются узлами с именем элемента "A".

selector = "A";
subtrees = findElement(tree,selector);
subtrees(1:10)

ans = 
  10×1 htmlTree:

    <A class="svg_link navbar-brand" href="https://www.mathworks.com?s_tid=gn_logo"><IMG alt="MathWorks" class="mw_logo" src="/images/responsive/global/pic-header-mathworks-logo.svg"/></A>
    <A class="mwa-nav_login" href="https://www.mathworks.com/login?uri=http://www.mathworks.com/help/textanalytics/index.html">Sign In</A>
    <A href="https://www.mathworks.com/products.html?s_tid=gn_ps">Products</A>
    <A href="https://www.mathworks.com/solutions.html?s_tid=gn_sol">Solutions</A>
    <A href="https://www.mathworks.com/academia.html?s_tid=gn_acad">Academia</A>
    <A href="https://www.mathworks.com/support.html?s_tid=gn_supp">Support</A>
    <A href="https://www.mathworks.com/matlabcentral/?s_tid=gn_mlc">Community</A>
    <A href="https://www.mathworks.com/company/events.html?s_tid=gn_ev">Events</A>
    <A href="https://www.mathworks.com/company/aboutus/contact_us.html?s_tid=gn_cntus">Contact Us</A>
    <A href="https://www.mathworks.com/store?s_cid=store_top_nav&amp;s_tid=gn_store">How to Buy</A>

Получите ссылки на гиперссылки с помощью getAttribute. Укажите имя атрибута "href".

attr = "href";
str = getAttribute(subtrees,attr);
str(1:10)

ans = 10×1 string array
    "https://www.mathworks.com?s_tid=gn_logo"
    "https://www.mathworks.com/login?uri=http://www.mathworks.com/help/textanalytics/index.html"
    "https://www.mathworks.com/products.html?s_tid=gn_ps"
    "https://www.mathworks.com/solutions.html?s_tid=gn_sol"
    "https://www.mathworks.com/academia.html?s_tid=gn_acad"
    "https://www.mathworks.com/support.html?s_tid=gn_supp"
    "https://www.mathworks.com/matlabcentral/?s_tid=gn_mlc"
    "https://www.mathworks.com/company/events.html?s_tid=gn_ev"
    "https://www.mathworks.com/company/aboutus/contact_us.html?s_tid=gn_cntus"
    "https://www.mathworks.com/store?s_cid=store_top_nav&s_tid=gn_store"

Преобразование синтаксического HTML Кода в строку

Открыть Live Script

Чтение HTML кода из URL- https://www.mathworks.com/help/textanalytics использование webread функция.

url = "https://www.mathworks.com/help/textanalytics";
code = webread(url);

Проанализируйте HTML кода с помощью htmlTree функция.

tree = htmlTree(code);

Найдите все абзацы в HTML с помощью findElement функция. Абзацы являются узлами с именем элемента «P».

subtrees = findElement(tree,"P");

Преобразуйте поддеревья в строку с помощью string функция.

str = string(subtrees)

str = 26×1 string
    "<P class="h1">↵  <A href="../index.html" class="coming_from_product">Documentation</A>↵  <A href="../index.html" class="not_coming_from_product">Help Center</A>↵</P>"
    "<P>Text Analytics Toolbox™ provides algorithms and visualizations for preprocessing, analyzing, and modeling text data. Models created with the toolbox can be used in applications such as sentiment analysis, predictive maintenance, and topic modeling.</P>"
    "<P>Text Analytics Toolbox includes tools for processing raw text from sources such as equipment logs, news feeds, surveys, operator reports, and social media. You can extract text from popular file formats, preprocess raw text, extract individual words, convert text into numerical representations, and build statistical models.</P>"
    "<P>Using machine learning techniques such as LSA, LDA, and word embeddings, you can find clusters and create features from high-dimensional text datasets. Features created with Text Analytics Toolbox can be combined with features from other data sources to build machine learning models that take advantage of textual, numeric, and other types of data.</P>"
    "<P class="category_desc">Learn the basics of Text Analytics Toolbox</P>"
    "<P class="category_desc">Import text data into MATLAB<SUP>®</SUP> and preprocess it for analysis</P>"
    "<P class="category_desc">Develop predictive models using topic models and word embeddings</P>"
    "<P class="category_desc">Visualize text data and models using word clouds and text scatter plots</P>"
    "<P class="category_desc">Information on language support in Text Analytics Toolbox</P>"
    "<P>You clicked a link that corresponds to this MATLAB command:</P>"
    "<P>Run the command by entering it in the MATLAB Command Window. Web browsers do not support MATLAB commands.</P>"
    "<P>Choose a web site to get translated content where available and see local events and offers. Based on your location, we recommend that you select: <STRONG class="recommended-country"/>.</P>"
    "<P>You can also select a web site from the following list:</P>"
    "<P>Select the China site (in Chinese or English) for best site performance. Other MathWorks country sites are not optimized for visits from your location.</P>"
    "<P class="text-center">↵  <A href="#" class="worldwide_link">Contact your local office</A>↵</P>"
    "<P class="ff_section_title">Explore Products</P>"
    "<P class="ff_section_title">Try or Buy</P>"
    "<P class="ff_section_title">Learn to Use</P>"
    "<P class="ff_section_title">Get Support</P>"
    "<P class="ff_section_title">About <SPAN translate="no">MathWorks</SPAN></P>"
    "<P class="h4 add_font_futura_medium add_margin_0">↵  <SPAN translate="no">MathWorks</SPAN>↵</P>"
    "<P>↵  <EM>Accelerating the pace of engineering and science</EM>↵</P>"
    "<P><SPAN translate="no">MathWorks</SPAN> is the leading developer of mathematical computing software for engineers and scientists.</P>"
    "<P>↵  <A href="/discovery.html?s_tid=all_disc_mw_ff">Discover...</A>↵</P>"
    "<P class="copyright" translate="no">© 1994-2021 The MathWorks, Inc.</P>"
    "<P>↵  <EM>Join the conversation</EM>↵</P>"

Подробнее о

расширить все

Элементы HTML

Типичный элемент HTML содержит следующие компоненты:

Имя элемента - Имя тега HTML. Имя элемента соответствует Name свойство HTML.
Атрибуты - Дополнительная информация о теге. Атрибуты HTML имеют форму name= «value", где name и value обозначить имя и значение атрибута соответственно. Атрибуты появляются в открывающем HTML. Чтобы получить значения атрибутов из HTML, используйте getAttribute.
Содержимое - Содержимое элемента. Содержимое отображается между открытием и закрытием HTML. Содержимым могут быть текстовые данные или вложенные элементы HTML. Чтобы извлечь текст из htmlTree объект, использование extractHTMLText. Чтобы получить вложенный HTML элементов htmlTree объект, используйте Children свойство.

Например, элемент HTML <a href="https://www.mathworks.com">Home</a> содержит следующие компоненты:

Компонент		Значение	Описание
Имя элемента		`a`	Элемент является гиперссылкой
Признак	Имя атрибута	`href`	Ссылка на гиперссылку
Признак	Значение атрибута	`"https://www.mathworks.com"`	Значение ссылки гиперссылки
Содержимое		`Home`	Текст для отображения

Вопросы совместимости

расширить все

`htmlTree` использует другой алгоритм для реструктуризации неправильной формы HTML

Поведение изменено в R2021a

При создании htmlTree объект, программное обеспечение автоматически перестраивает неправильно сформированные входы HTML кода, чтобы иметь допустимую структуру. Этот процесс реструктуризации включает добавление, удаление и редактирование элементов, а также реорганизацию древовидной структуры. Начиная с R2021a, программное обеспечение использует обновленный алгоритм для реструктуризации неправильно сформированного HTML. Это изменение может привести к htmlTree объекты, созданные в R2021a или более поздней версии, имеющие разный размер, структуру и содержимое по сравнению с предыдущими релизами.

Начиная с R2021a, при загрузке htmlTree объекты из файлов MAT, созданных в R2020b или ранее, программное обеспечение автоматически перестраивает htmlTree объект, использующий тот же алгоритм, используемый для создания htmlTree объекты. При загрузке htmlTree объекты из MAT файлов, созданные в R2021a или более поздних версиях, программное обеспечение не реструктуризирует htmlTree объект.

В этой таблице освещаются некоторые заметные шаги процесса реструктуризации:

Шаг Изменение поведения

Автоматически добавляйте элементы заголовка и заголовка.

Шаг	Изменение поведения
Автоматически добавляйте элементы заголовка и заголовка.	Начиная с R2021a, при создании `htmlTree` объект из HTML кода, программное обеспечение автоматически вставляет отсутствующие `<HEAD>`, `<TITLE>`, и другие элементы. В предыдущих версиях `htmlTree` объект включал эти элементы только тогда, когда они присутствуют в коде входа. При загрузке `htmlTree` объекты из MAT файлов, созданные в более раннем релизе, программа автоматически вставляет `<HEAD>` и `<TITLE>` элементы. При загрузке `htmlTree` объекты из файлов MAT, созданных в R2021a или более поздних версиях, программное обеспечение не вставляет эти элементы автоматически.
Автоматическое добавление отсутствующих элементов.	Начиная с R2021a, при создании `htmlTree` объект из HTML кода, программа автоматически вставляет отсутствующие элементы, когда родительские элементы и дочерние элементы противоречивы. Для примера, когда `<li>` (элемент списка) элемент не имеет родительского `<ul>` (неупорядоченный список) или `<ol>` (неупорядоченный список) элемент, программное обеспечение автоматически добавляет `<ul>` элемент, делающий HTML допустимым. Это может привести к различным выходам по сравнению с более ранними релизами. При загрузке `htmlTree` объекты из файлов MAT, созданных в более раннем релизе, программа автоматически вставляет отсутствующие элементы. При загрузке `htmlTree` объекты из файлов MAT, созданных в R2021a или более поздних версиях, программа не вставляет автоматически отсутствующие элементы.
Отбросьте части неверно сформированного кода.	При создании `htmlTree` объект с неправильной формой HTML кода, программное обеспечение может отбрасывать части текста. Для примера, если код входа является строкой `"<div>a</"`, затем программа отбрасывает текст `"a</"`.

Начиная с R2021a, при создании htmlTree объект из HTML кода, программное обеспечение автоматически вставляет отсутствующие <HEAD>, <TITLE>, и другие элементы. В предыдущих версиях htmlTree объект включал эти элементы только тогда, когда они присутствуют в коде входа.

При загрузке htmlTree объекты из MAT файлов, созданные в более раннем релизе, программа автоматически вставляет <HEAD> и <TITLE> элементы. При загрузке htmlTree объекты из файлов MAT, созданных в R2021a или более поздних версиях, программное обеспечение не вставляет эти элементы автоматически.

Автоматическое добавление отсутствующих элементов.

Начиная с R2021a, при создании htmlTree объект из HTML кода, программа автоматически вставляет отсутствующие элементы, когда родительские элементы и дочерние элементы противоречивы. Для примера, когда <li> (элемент списка) элемент не имеет родительского <ul> (неупорядоченный список) или <ol> (неупорядоченный список) элемент, программное обеспечение автоматически добавляет <ul> элемент, делающий HTML допустимым. Это может привести к различным выходам по сравнению с более ранними релизами.

При загрузке htmlTree объекты из файлов MAT, созданных в более раннем релизе, программа автоматически вставляет отсутствующие элементы. При загрузке htmlTree объекты из файлов MAT, созданных в R2021a или более поздних версиях, программа не вставляет автоматически отсутствующие элементы.

Отбросьте части неверно сформированного кода.

При создании htmlTree объект с неправильной формой HTML кода, программное обеспечение может отбрасывать части текста. Для примера, если код входа является строкой "<div>a</", затем программа отбрасывает текст "a</".

См. также

Темы

Введенный в R2018b

Документация

htmlTree

Описание

Создание

Синтаксис

Описание

Входные параметры

`code` - HTML
массив строк | символьный вектор | ячеек из символьных векторов

Свойства

`Children` - Прямые потомки элемента
`htmlTree` массив

`Parent` - Родительский узел
`htmlTree` объект

`Name` - имя элемента HTML
строковый скаляр

Функции объекта

Примеры

Синтаксический анализ кода HTML

Поиск элементов в HTML

Получение атрибута HTML

Преобразование синтаксического HTML Кода в строку

Подробнее о

Элементы HTML

Вопросы совместимости

`htmlTree` использует другой алгоритм для реструктуризации неправильной формы HTML

См. также

Темы

Symbolic Math Toolbox

Поддержка

Документация

htmlTree

Описание

Создание

Синтаксис

Описание

Входные параметры

code - HTML массив строк | символьный вектор | ячеек из символьных векторов

Свойства

Children - Прямые потомки элемента htmlTree массив

Parent - Родительский узел htmlTree объект

Name - имя элемента HTML строковый скаляр

Функции объекта

Примеры

Синтаксический анализ кода HTML

Поиск элементов в HTML

Получение атрибута HTML

Преобразование синтаксического HTML Кода в строку

Подробнее о

Элементы HTML

Вопросы совместимости

htmlTree использует другой алгоритм для реструктуризации неправильной формы HTML

См. также

Темы

Symbolic Math Toolbox

Поддержка

`code` - HTML
массив строк | символьный вектор | ячеек из символьных векторов

`Children` - Прямые потомки элемента
`htmlTree` массив

`Parent` - Родительский узел
`htmlTree` объект

`Name` - имя элемента HTML
строковый скаляр

`htmlTree` использует другой алгоритм для реструктуризации неправильной формы HTML