extractHTMLText

Извлеките текст от HTML

свернуть все на странице

Синтаксис

str = extractHTMLText(code)

str = extractHTMLText(tree)

str = extractHTMLText(___,'ExtractionMethod',ex)

Описание

пример

str = extractHTMLText(code) анализирует код HTML в code и извлекает текст.

пример

str = extractHTMLText(tree) извлекает текст от дерева HTML.

str = extractHTMLText(___,'ExtractionMethod',ex) также задает метод экстракции, чтобы использовать.

Примеры

свернуть все

Извлеките текст от HTML

Попробовать в MATLAB

Чтобы извлечь текстовые данные непосредственно из кода HTML, используйте extractHTMLText и задайте код HTML как строку.

code = "<html><body><h1>THE SONNETS</h1><p>by William Shakespeare</p></body></html>";
str = extractHTMLText(code)

str = 
    "THE SONNETS
     
     by William Shakespeare"

Извлеките текст от веб-сайта

Попробовать в MATLAB

Чтобы извлечь текстовые данные из веб-страницы, сначала используйте функцию webread, чтобы считать код HTML. Затем используйте функцию extractHTMLText на возвращенном коде.

url = "https://www.mathworks.com/help/textanalytics";
code = webread(url);
str = extractHTMLText(code)

str = 
    'Text Analytics Toolbox™ provides algorithms and visualizations for preprocessing, analyzing, and modeling text data. Models created with the toolbox can be used in applications such as sentiment analysis, predictive maintenance, and topic modeling.
     
     Text Analytics Toolbox includes tools for processing raw text from sources such as equipment logs, news feeds, surveys, operator reports, and social media. You can extract text from popular file formats, preprocess raw text, extract individual words, convert text into numerical representations, and build statistical models.
     
     Using machine learning techniques such as LSA, LDA, and word embeddings, you can find clusters and create features from high-dimensional text datasets. Features created with Text Analytics Toolbox can be combined with features from other data sources to build machine learning models that take advantage of textual, numeric, and other types of data.'

Найдите элементы в дереве HTML

Попробовать в MATLAB

Считайте код HTML из https://www.mathworks.com/help/textanalytics URL с помощью функции webread.

url = "https://www.mathworks.com/help/textanalytics";
code = webread(url);

Проанализируйте код HTML с помощью htmlTree.

tree = htmlTree(code);

Найдите все гиперссылки в дереве HTML использованием findElement. Гиперссылки являются узлами с именем элемента "A".

selector = "A";
subtrees = findElement(tree,selector);

Просмотрите первые несколько поддеревьев.

subtrees(1:10)

ans = 
  10×1 htmlTree:

   (1,1)  <A class="svg_link navbar-brand" href="https://www.mathworks.com?s_ti…
   (2,1)  <A class="mwa-nav_login" href="https://www.mathworks.com/login?uri=ht…
   (3,1)  <A href="https://www.mathworks.com/products.html?s_tid=gn_ps">Product…
   (4,1)  <A href="https://www.mathworks.com/solutions.html?s_tid=gn_sol">Solut…
   (5,1)  <A href="https://www.mathworks.com/academia.html?s_tid=gn_acad">Acade…
   (6,1)  <A href="https://www.mathworks.com/support.html?s_tid=gn_supp">Suppor…
   (7,1)  <A href="https://www.mathworks.com/matlabcentral/?s_tid=gn_mlc">Commu…
   (8,1)  <A href="https://www.mathworks.com/company/events.html?s_tid=gn_ev">E…
   (9,1)  <A href="https://www.mathworks.com/company/aboutus/contact_us.html?s_…
  (10,1)  <A href="https://www.mathworks.com/store?s_cid=store_top_nav&amp;s_ti…

Извлеките текст от поддеревьев с помощью extractHTMLText. Результат содержит текст ссылки от каждой ссылки на странице.

str = extractHTMLText(subtrees);
str(1:10)

ans = 10×1 string array
    ""
    "Sign In"
    "Products"
    "Solutions"
    "Academia"
    "Support"
    "Community"
    "Events"
    "Contact Us"
    "How to Buy"

Входные параметры

свернуть все

`code` — Код HTML
массив строк | вектор символов | массив ячеек из символьных векторов

Код HTML, заданный как массив строк, вектор символов или массив ячеек из символьных векторов.

Совет

Чтобы считать код HTML из веб-страницы, используйте webread.
Чтобы извлечь текст из файла HTML, используйте extractFileText.

Пример: "<a href='https://www.mathworks.com'>MathWorks</a>"

Типы данных: char | string | cell

`tree` — Дерево HTML
Массив `htmlTree`

Дерево HTML, заданное как массив htmlTree.

`ex` — Метод экстракции
`'tree'` (значение по умолчанию) | `'article'` | `'all-text'`

Метод экстракции, заданный как одно из следующего:

Опция	Описание
`'tree'`	Анализируйте дерево DOM и текстовое содержимое, затем извлеките блок абзацев.
`'article'`	Обнаружьте текст статьи и извлеките блок абзацев.
`'all-text'`	Извлеките весь текст в теле HTML, за исключением стилей CSS и скриптов.

Документация

extractHTMLText

Синтаксис

Описание

Примеры

Извлеките текст от HTML

Извлеките текст от веб-сайта

Найдите элементы в дереве HTML

Входные параметры

`code` — Код HTML
массив строк | вектор символов | массив ячеек из символьных векторов

Совет

`tree` — Дерево HTML
Массив `htmlTree`

`ex` — Метод экстракции
`'tree'` (значение по умолчанию) | `'article'` | `'all-text'`

Смотрите также

Темы

Введенный в R2018a

Документация Text Analytics Toolbox

Поддержка

Документация

extractHTMLText

Синтаксис

Описание

Примеры

Извлеките текст от HTML

Извлеките текст от веб-сайта

Найдите элементы в дереве HTML

Входные параметры

code — Код HTML массив строк | вектор символов | массив ячеек из символьных векторов

Совет

tree — Дерево HTML Массив htmlTree

ex — Метод экстракции 'tree' (значение по умолчанию) | 'article' | 'all-text'

Смотрите также

Темы

Введенный в R2018a

Документация Text Analytics Toolbox

Поддержка

`code` — Код HTML
массив строк | вектор символов | массив ячеек из символьных векторов

`tree` — Дерево HTML
Массив `htmlTree`

`ex` — Метод экстракции
`'tree'` (значение по умолчанию) | `'article'` | `'all-text'`