removeLongWords

Удалите длинные слова из документов или модели мешка слов

Описание

пример

newDocuments = removeLongWords(documents,len) удаляет слова длины len или больше от documents.

пример

newBag = removeLongWords(bag,len) удаляет слова длины len или больше от bagOfWords bag объекта.

Примеры

свернуть все

Удалите слова с семью или более символами из документа.

document = tokenizedDocument("An example of a short sentence");
newDocument = removeLongWords(document,7)
newDocument = 
  tokenizedDocument:

   4 tokens: An of a short

Удалите слова с семью или более символами из модели мешка слов.

documents = tokenizedDocument([ ...
    "an example of a short sentence"
    "a second short sentence"]);
bag = bagOfWords(documents);
newBag = removeLongWords(bag,7)
newBag = 
  bagOfWords with properties:

          Counts: [2x5 double]
      Vocabulary: ["an"    "of"    "a"    "short"    "second"]
        NumWords: 5
    NumDocuments: 2

Входные параметры

свернуть все

Входные документы, заданные как tokenizedDocument массив.

Вход пакета слов, заданная как bagOfWords объект.

Минимальная длина слов для удаления, заданная как положительное целое число. Функция удаляет слова с len или более длинные символы.

Выходные аргументы

свернуть все

Выходные документы, возвращенные как tokenizedDocument массив.

Выходная модель мешка слов, возвращенная как bagOfWords объект.

Введенный в R2017b