Cheat Sheet

Text Analytics Toolbox 快速入门

通过语义文本挖掘过程从各种文档类型中提取潜在信息

Text Analytics Toolbox™ 提供用于文本数据预处理、分析和建模的算法和可视化功能。使用该工具箱创建的模型可用于情感分析、预测性维护和主题建模等应用。

函数名称 描述
wordcloud 从词袋或 LDA 模型创建词云图
wordCloudCounts 统计单词数以创建词云
textscatter 文本的二维散点图
textscatter3 文本的三维散点图
heatmap 创建热图
histcounts 直方图箱计数
discretize 将数据划分到箱或类别中
词云

可视化

使用词云和文本散点图来汇总和验证结果。

无监督学习

建模和预测

使用词袋或预训练的词嵌入模型将文本转换为数值表示形式,并应用专用机器学习算法进行预测和主题建模。

函数名称 描述
readWordEmbedding 从文本文件读取词嵌入
trainWordEmbedding 训练词嵌入
word2vec/vec2word 将词映射到嵌入向量
ldaModel 隐含狄利克雷分配 (LDA) 模型
lsaModel 潜在语义分析 (LSA) 模型
bagOfWords 词袋模型
fitlda 拟合隐含狄利克雷分配 (LDA) 模型
fitlsa 拟合潜在语义分析 (LSA) 模型
predict 预测文档的主要 LDA 主题
fitdist 对数据进行概率分布对象拟合
fitrlinear 对高维数据进行线性回归模型拟合
fitclinear 对高维数据进行线性分类模型拟合
fitcecoc 对分类器进行多类模型拟合
函数名称 描述
extractFileText 从 PDF、Microsoft Word 和纯文本文件中读取
textscan 从文本文件或字符串中读取格式化数据
readtable 基于文件创建表
compose 将数据转换为格式化字符串数组
xlsread 读取 Microsoft Excel 电子表格文件
webread 从 RESTful Web 服务读取内容
TabularTextDatastore 用于表格文本文件的数据存储
FileDatastore 具有自定义文件读取器的数据存储
SpreadsheetDatastore 用于电子表格文件的数据存储
PDF、文本文件和电子表格图标

导入

从 Microsoft® Word® 文件、PDF、文本文件和电子表格中提取文本。

预处理文本

预处理

删除常见词、标点符号、URL 等无用干扰项,并通过文本规范化将单词还原为词根。

函数名称 描述
tokenizedDocument 将文档拆分为单词集合
normalizeWords 使用 Porter 词干提取器去除单词的词形变化
bagOfWords 词袋模型
stopWords 停用词列表
context 在上下文中搜索文档中的单词出现位置
removeWords 从文档或词袋中删除选定词
removeLongWords 从文档或词袋中删除长词
removeShortWords 从文档或词袋中删除短词
removeInfrequentWords 从词袋模型中删除出现次数较少的词
erasePunctuation 从文本和文档中删除标点符号
函数名称 描述
str = "Hello, world" 声明字符串变量
str = ["Hello","World"] 声明字符串数组
str = string(C) 将字符向量 C 转换为字符串
str2double 将字符串转换为双精度数
strlength 返回字符串的长度
isstring 确定输入是否为字符串数组
join 合并字符串
split 拆分字符串数组中的字符串
splitlines 在换行符处拆分字符串
replace 查找并替换字符串数组中的子字符串
contains 确定字符串中是否包含模式
erase 删除字符串中的子字符串
extractBetween 提取指示符之间的子字符串
extractAfter 提取指定位置后的子字符串
extractBefore 提取指定位置之前的子字符串
strcmp 比较字符串
regexp 匹配正则表达式(区分大小写)
"Hello,world"

字符串

高效地操作、比较和存储文本数据。