Text Analytics Toolboxで品詞でフィルタしたものを、Token化するにはどうしたら良いでしょうか？

%% 解析用データの読込み（「吾輩は猫である」を読み込んでいます）
url = "https://www.aozora.gr.jp/cards/000148/files/789_14547.html";
options = weboptions('CharacterEncoding','Shift_JIS');
code = webread(url,options);
textData = extractHTMLText(code);
textData = string(split(textData,newline));
idx = textData == "";
textData(idx) = [];
%% トークン化
documents = tokenizedDocument(textData);
%% 品詞情報の取得
tdetails = tokenDetails(documents);
head(tdetails)
%% 名詞の抽出
idx = tdetails.PartOfSpeech == "noun";
%% 再びトークン化
tokens = tdetails(idx,:);
for ii = 1:max(tokens.DocumentNumber)
    try
        str(ii,:) = join(tokens.Token(tokens.DocumentNumber == ii));
    end
end
documents = tokenizedDocument(str)
documents.Vocabulary

1 个评论
显示 -1更早的评论隐藏 -1更早的评论

Takafumi Amano 2021-3-8

ありがとうございました。

無事に意図したものができました。

请先登录，再进行评论。

Text Analytics Toolboxで品詞でフィルタしたものを、Token化するにはどうしたら良いでしょうか？

0 个评论
显示 -2更早的评论隐藏 -2更早的评论

采纳的回答

1 个评论
显示 -1更早的评论隐藏 -1更早的评论

更多回答（0 个）

类别

产品

标签

Community Treasure Hunt

Text Analytics Toolboxで品詞​でフィルタしたものを​、Token化するに​はどうしたら良いでし​ょうか？

0 个评论 显示 -2更早的评论 隐藏 -2更早的评论

采纳的回答

1 个评论 显示 -1更早的评论 隐藏 -1更早的评论

更多回答（0 个）

类别

产品

标签

另请参阅

Community Treasure Hunt

Text Analytics Toolboxで品詞でフィルタしたものを、Token化するにはどうしたら良いでしょうか？

0 个评论
显示 -2更早的评论隐藏 -2更早的评论

1 个评论
显示 -1更早的评论隐藏 -1更早的评论