removeInfrequentWords

Удалите слова с низким количеством из модели мешка слов

Синтаксис

newBag = removeInfrequentWords(bag,count)

newBag = removeInfrequentWords(bag,count,'IgnoreCase',true)

Описание

newBag = removeInfrequentWords(bag,count) удаляет слова, которые появляются самое большее count всего раз из модели мешка слов bag. Функция по умолчанию чувствительна к регистру.

пример

newBag = removeInfrequentWords(bag,count,'IgnoreCase',true) удаляет слова, которые появляются самое большее count раз в общем проигнорировании случая. Если слова различаются только по регистрам, то соответствующие счетчики объединяются.

Примеры

свернуть все

Удаление нечастых слов

Открыть Live Script

Удалите слова, которые появляются в два раза или меньше из модели мешка слов.

Создайте модель мешка слов из массива токенизированных документов.

documents = tokenizedDocument([
    "an example of a short sentence"
    "a second short sentence"
    "another example"
    "a short example"]);
bag = bagOfWords(documents)

bag = 
  bagOfWords with properties:

          Counts: [4x8 double]
      Vocabulary: [1x8 string]
        NumWords: 8
    NumDocuments: 4

Удалите слова, которые появляются в два раза или меньше из модели мешка слов.

count = 2;
newBag = removeInfrequentWords(bag,count)

newBag = 
  bagOfWords with properties:

          Counts: [4x3 double]
      Vocabulary: ["example"    "a"    "short"]
        NumWords: 3
    NumDocuments: 4

Входные параметры

свернуть все

`bag` - Вход пакета слов
`bagOfWords` объект

Вход пакета слов, заданная как bagOfWords объект.

`count` - Счетчик порога для удаления слов
положительное целое число

Счетчик порога для удаления слов, заданный как положительное целое число. Функция удаляет появившиеся слова count раз в общей сложности или меньше.

См. также

Темы

Введенный в R2017b

Symbolic Math Toolbox

Поддержка

Памятка переводчика

1. Если смысл перевода понятен, то лучше оставьте как есть и не придирайтесь к словам, синонимам и тому подобному. О вкусах не спорим.

2. Не дополняйте перевод комментариями “от себя”. В исправлении не должно появляться дополнительных смыслов и комментариев, отсутствующих в оригинале. Такие правки не получится интегрировать в алгоритме автоматического перевода.

3. Сохраняйте структуру оригинального текста - например, не разбивайте одно предложение на два.

4. Не имеет смысла однотипное исправление перевода какого-то термина во всех предложениях. Исправляйте только в одном месте. Когда Вашу правку одобрят, это исправление будет алгоритмически распространено и на другие части документации.

5. По иным вопросам, например если надо исправить заблокированное для перевода слово, обратитесь к редакторам через форму технической поддержки.

Документация