Text Analytics Toolbox 快速入门
Text Analytics Toolbox™ 提供用于文本数据预处理、分析和建模的算法和可视化功能。使用该工具箱创建的模型可用于情感分析、预测性维护和主题建模等应用。
| 函数名称 | 描述 |
|---|---|
wordcloud |
从词袋或 LDA 模型创建词云图 |
wordCloudCounts |
统计单词数以创建词云 |
textscatter |
文本的二维散点图 |
textscatter3 |
文本的三维散点图 |
heatmap |
创建热图 |
histcounts |
直方图箱计数 |
discretize |
将数据划分到箱或类别中 |
可视化
使用词云和文本散点图来汇总和验证结果。
| 函数名称 | 描述 |
|---|---|
readWordEmbedding |
从文本文件读取词嵌入 |
trainWordEmbedding |
训练词嵌入 |
word2vec/vec2word |
将词映射到嵌入向量 |
ldaModel |
隐含狄利克雷分配 (LDA) 模型 |
lsaModel |
潜在语义分析 (LSA) 模型 |
bagOfWords |
词袋模型 |
fitlda |
拟合隐含狄利克雷分配 (LDA) 模型 |
fitlsa |
拟合潜在语义分析 (LSA) 模型 |
predict |
预测文档的主要 LDA 主题 |
fitdist |
对数据进行概率分布对象拟合 |
fitrlinear |
对高维数据进行线性回归模型拟合 |
fitclinear |
对高维数据进行线性分类模型拟合 |
fitcecoc |
对分类器进行多类模型拟合 |
| 函数名称 | 描述 |
|---|---|
extractFileText |
从 PDF、Microsoft Word 和纯文本文件中读取 |
textscan |
从文本文件或字符串中读取格式化数据 |
readtable |
基于文件创建表 |
compose |
将数据转换为格式化字符串数组 |
xlsread |
读取 Microsoft Excel 电子表格文件 |
webread |
从 RESTful Web 服务读取内容 |
TabularTextDatastore |
用于表格文本文件的数据存储 |
FileDatastore |
具有自定义文件读取器的数据存储 |
SpreadsheetDatastore |
用于电子表格文件的数据存储 |
| 函数名称 | 描述 |
|---|---|
tokenizedDocument |
将文档拆分为单词集合 |
normalizeWords |
使用 Porter 词干提取器去除单词的词形变化 |
bagOfWords |
词袋模型 |
stopWords |
停用词列表 |
context |
在上下文中搜索文档中的单词出现位置 |
removeWords |
从文档或词袋中删除选定词 |
removeLongWords |
从文档或词袋中删除长词 |
removeShortWords |
从文档或词袋中删除短词 |
removeInfrequentWords |
从词袋模型中删除出现次数较少的词 |
erasePunctuation |
从文本和文档中删除标点符号 |
| 函数名称 | 描述 |
|---|---|
str = "Hello, world" |
声明字符串变量 |
str = ["Hello","World"] |
声明字符串数组 |
str = string(C) |
将字符向量 C 转换为字符串 |
str2double |
将字符串转换为双精度数 |
strlength |
返回字符串的长度 |
isstring |
确定输入是否为字符串数组 |
join |
合并字符串 |
split |
拆分字符串数组中的字符串 |
splitlines |
在换行符处拆分字符串 |
replace |
查找并替换字符串数组中的子字符串 |
contains |
确定字符串中是否包含模式 |
erase |
删除字符串中的子字符串 |
extractBetween |
提取指示符之间的子字符串 |
extractAfter |
提取指定位置后的子字符串 |
extractBefore |
提取指定位置之前的子字符串 |
strcmp |
比较字符串 |
regexp |
匹配正则表达式(区分大小写) |