)
1. 文本可视化释义1.1. 文本是语言和沟通的载体文本的含义以及读者对文本的理解需求均纷繁复杂1.2. 文本信息无处不在邮件、新闻、工作报告等都是日常工作中需要处理的文本信息1.3. 一图胜千言指一张图像传达的信息等同于相当多文字的堆积描述1.3.1. 用户通过感知和辨析可视图元提取信息1.4. 文本可视化技术采用可视表达技术刻画文本和文档直观地呈现文档中的有效信息1.5. 如何辅助用户准确无误地从文本中提取并简洁直观地展示信息是文本可视化的核心问题之一1.6. 标签云技术已是诸多网站展示其关键词的常用技术信息文本图是美国纽约时报等各大纸媒辅助用户理解新闻内容的必备方法1.7. 文本可视化不同于具有空间属性的科学可视化—文本信息没有空间位置等结构化信息1.8. 如何将没有空间结构属性的文本信息转换为用户乐于接受的二维或三维空间的可视表达结果是文本可视化面临的一个核心问题1.9. 如何将文本分析模型和信息可视化技术无缝结合如何更好地处理海量、时变、具备多重语义的文本信息是极大的研究挑战2. 文本信息的层级2.1. 语义单元2.1.1. Token2.1.2. 是由一个或多个字符组成的词元它是文本信息的最小单元2.1.3. 语义单元通常通过基于规则分割文本的分词技术Tokenization提取2.1.4. 最常用的方法是*正则表达式定义的有限状态机2.2. 词汇级2.2.1. Lexical Level2.2.2. 指从一连串的文本文字中提取的语义单元信息2.2.3. 词汇级可提取的信息包括文本涉及的字、词、短语以及它们在文章内的分布统计、词根词位等相关信息2.2.4. 常见的文本关键字即属于词汇级别2.3. 语法级2.3.1. Syntactic Level2.3.2. 指基于文本的语言结构对词汇级的语义单元进一步分析和解释而提取的信息2.3.3. 语义单元的语法属性属于语法级信息2.3.3.1. 词性、单复数、词与词之间的相似性2.3.3.2. 地点、时间、日期、人名等实体信息2.3.3.3. 属性可以通过语法分析器识别2.3.4. 语法级信息的提取过程被称作*命名实体识别方法Named Entity Recognition2.4. 语义级2.4.1. Semantic Level2.4.2. 是研究文本整体所表达的语义内容信息和语义关系是*文本的最高层信息2.4.3. 包括深入分析词汇级和语法级所提取的知识在文本中的含义2.4.3.1. 文本的字词、短语等在文本中的含义和彼此间的关系2.4.4. 包括作者通过文本所传达的信息2.4.4.1. 文档的主题3. 文本可视化的研究内容与任务3.1. 人类理解文本信息的需求是文本可视化的研究动机3.2. 研究内容3.2.1. 以文本文档的类别作为归纳标准的文本可视化3.2.1.1. 单文本可视化3.2.1.2. 文本集合可视化3.2.1.3. 时序性可视化3.2.2. 以文本文档的内容作为归纳标准3.2.2.1. 文学作品可视化3.2.2.2. 在线社交媒体可视化3.2.2.3. 科学论文/专利可视化3.2.2.4. 在线沟通数据可视化3.2.2.5. 电影影评可视化3.2.2.6. 医疗报告可视化3.3. 分析任务3.3.1. 对文本的内容、特征进行总结包括对词汇、句法的分析分析文本中讨论的主题研究文本中蕴含的情感挖掘文本中描述的事件关联分析多源文档数据的内容、特征等4. 文本可视化流程4.1. 文本可视化是基于任务需求的因而挖掘信息的计算模型受到文本可视分析任务的引导4.2. 可视和交互的设计必须在理解所使用的信息提取模型的原理基础上进行4.3. 文本信息挖掘4.3.1. 文本数据的预处理4.3.1.1. 文本信息的提取通常基于文本内容进行然而*原始文本存在着无用甚至干扰的信息4.3.1.2. 原始文本数据的格式亦是多种多样的4.3.1.3. 对文本数据进行预处理可有效过滤文本中的冗余和无用信息提取重要的文本素材4.3.2. 文本特征的抽取4.3.2.1. 文本分析任务需要相关的文本特征来度量可采用文本挖掘技术提取任务所需要的特征信息4.3.2.2. 词汇级的关键词、词频分布语法级的实体信息语义级的主题等4.3.3. 文本特征的度量4.3.3.1. 向量空间模型是最常用的方法4.4. 视图绘制4.4.1. 图元布局算法则要求有效而不失美感地布局图元使得可视表达符合人类的感知4.5. 人机交互4.5.1. 人机交互是关于用户如何生成视图和满足分析需求而操作视图的技术5. 文本信息分析基础5.1. 分词技术和词干提取5.1.1. 分词Tokenization指将一段文字划分为多个词项剔除停词从文字中提取出有意义的词项5.1.2. 词干提取Stemming指去除词缀得到词根得到单词最一般写法的技术5.1.3. 词干提取避免了同一个词的不同表现形式对文本分析带来的干扰5.2. 词汇级模型5.2.1. 向量空间模型Vector Space Model指利用向量符号对文本进行度量的代数模型指代一系列向量空间的定义、生成、度量和应用的方法与技术常用于自然语言处理、信息检索等领域5.2.2. 词袋模型5.2.2.1. Bag-of-words Model5.2.2.2. 是向量空间模型构造文本向量的常用方法用来提取词汇级文本信息5.2.3. 文本相似性度量5.2.3.1. 向量空间模型可用于度量文本之间的相似性5.2.3.2. 采用词项-文档矩阵来构建多个文档的数学模型其中一个向量代表一个文本如文本词频特征向量并施以空间向量的运算来刻画多个文本向量间的语义相似性5.2.3.3. 向量空间模型可应用于不同的文本分析、文本可视化和信息检索任务中5.2.4. TF-IDF5.2.4.1. 对于向量空间模型来说为文档中的每个词合理地分配权重非常重要5.2.4.2. Term Frequency-Inverse Document FrequencyTF-IDF*是最常用的方法5.2.4.3. TF-IDF用以评估一个单词或字对于一个文档集或一个语料库中的其中一份文档的重要程度5.2.4.4. 核心思想是字词对于某个文档的重要性随着它在这个文档中出现的次数成正相关增加但同时会随着它在文档集中出现的频率而负相关下降5.2.5. N元语法5.2.5.1. N-grams5.2.5.2. 是一种常用的语言模型可用于估计文本中某个单词序列出现的概率5.2.5.3. 根据相对频率计数估计概率是最直接的概率估计方式5.3. 语法级模型5.3.1. 语法分析树或分析树Parse Tree是一种用于反映文本语句及其语法关系的有序树结构5.3.2. 自顶向下算法5.3.2.1. 从树结构的根节点开始构建包括上下文无关语法、概率上下文无关语法、Earley算法等5.3.2.2. 能够尽可能避免搜索不可能在给定根节点的树中找不到位置的子树5.3.3. 自底向上算法5.3.3.1. 它从树结构的叶节点开始构建包括Cocke-Kasami-Younger算法等5.3.3.2. 能够避免搜索不以实际输入为基础的树5.4. 语言义模型5.4.1. 主题抽取5.4.1.1. 主题模型指从语义级别描述文本集合内各个文本的语义内容即文本的主题描述5.4.1.2. 一个文档的语义内容可描述为多个主题的组合表达而一个主题可认为是一系列词的概率分布或权重分布5.4.1.3. 基于矩阵分解的非概率模型5.4.1.3.1. 在非概率性方法中词项-文档矩阵被投影到K维空间中其中每个维度代表一个主题5.4.1.4. 基于贝叶斯的概率模型5.4.1.4.1. 在概率性的主题模型算法中主题被看成多个词项的概率分布文档理解为多个主题的组合而产生5.4.2. 词嵌入模型5.4.2.1. 词嵌入*是自然语言处理中语言模型和表征学习技术的统称5.4.2.2. 将每个单词表示为一个高维向量常见的表示包括独热表示、分布式表示等再将这个高维向量嵌入一个低维连续向量空间中5.4.2.3. word2vec5.4.2.3.1. 是一种用来实现词嵌入的工具它依赖Skip-grams或连续词袋Continous Bag of Words,CBOW模型来建立神经网络