什么是文本挖掘

文本挖掘是一门交叉性学科,涉及数据挖掘、机器学习、模式识别、人工智能、统计学、计算机语言学、计算机网络技术、信息学等多个领域。文本挖掘就是从大量的文档中发现隐含知识和模式的一种方法和工具,它从数据挖掘发展而来,但与传统的数据挖掘又有许多不同。文本挖掘的对象是海量、异构、分布的文档(web);文档内容是人类所使用的自然语言,缺乏计算机可理解的语义。

传统数据挖掘所处理的数据是结构化的,而文档(web)都是半结构或无结构的。所以,文本挖掘面临的首要问题是如何在计算机中合理地表示文本,使之既要包含足够的信息以反映文本的特征,又不至于过于复杂使学习算法无法处理。在浩如烟海的网络信息中,80%的信息是以文本的形式存放的,WEB文本挖掘是WEB内容挖掘的一种重要形式。

文本的表示及其特征项的选取是文本挖掘、信息检索的一个基本问题,它把从文本中抽取出的特征词进行量化来表示文本信息。将它们从一个无结构的原始文本转化为结构化的计算机可以识别处理的信息,即对文本进行科学的抽象,建立它的数学模型,用以描述和代替文本。使计算机能够通过对这种模型的计算和操作来实现对文本的识别。由于文本是非结构化的数据,要想从大量的文本中挖掘有用的信息就必须首先将文本转化为可处理的结构化形式。

目前人们通常采用向量空间模型来描述文本向量,但是如果直接用分词算法和词频统计方法得到的特征项来表示文本向量中的各个维,那么这个向量的维度将是非常的大。这种未经处理的文本矢量不仅给后续工作带来巨大的计算开销,使整个处理过程的效率非常低下,而且会损害分类、聚类算法的精确性,从而使所得到的结果很难令人满意。因此,必须对文本向量做进一步净化处理,在保证原文含义的基础上,找出对文本特征类别最具代表性的文本特征。为了解决这个问题,最有效的办法就是通过特征选择来降维。

目前有关文本表示的研究主要集中于文本表示模型的选择和特征词选择算法的选取上。用于表示文本的基本单位通常称为文本的特征或特征项。特征项必须具备一定的特性:

1)特征项要能够确实标识文本内容;

2)特征项具有将目标文本与其他文本相区分的能力;

3)特征项的个数不能太多;

4)特征项分离要比较容易实现。

在中文文本中可以采用字、词或短语作为表示文本的特征项。相比较而言,词比字具有更强的表达能力,而词和短语相比,词的切分难度比短语的切分难度小得多。因此,目前大多数中文文本分类系统都采用词作为特征项,称作特征词。这些特征词作为文档的中间表示形式,用来实现文档与文档、文档与用户目标之间的相似度计算。如果把所有的词都作为特征项,那么特征向量的维数将过于巨大,从而导致计算量太大,在这样的情况下,要完成文本分类几乎是不可能的。特征抽取的主要功能是在不损伤文本核心信息的情况下尽量减少要处理的单词数,以此来降低向量空间维数,从而简化计算,提高文本处理的速度和效率。

文本特征选择对文本内容的过滤和分类、聚类处理、自动摘要以及用户兴趣模式发现、知识发现等有关方面的研究都有非常重要的影响。通常根据某个特征评估函数计算各个特征的评分值,然后按评分值对这些特征进行排序,选取若干个评分值最高的作为特征词,这就是特征抽取(FeatureSelection)。

特征选取的方式常见的有4种:

(I)用映射或变换的方法把原始特征变换为较少的新特征。

(2)从原始特征中挑选出一些最具代表性的特征。

(3)根据专家的知识挑选最有影响的特征。

(4)用数学的方法进行选取,找出最具分类信息的特征,这种方法是一种比较精确的方法,人为因素的干扰较少,尤其适合于文本自动分类挖掘系统的应用。

随着网络知识组织、人工智能等学科的发展,文本特征提取将向着数字化、智能化、语义化的方向深入发展,在社会知识管理方面发挥更大的作用。

玩转大数据,其实是在挖掘人性需求

今日资本的徐新女士当年准备投京东的时候,刘强东把后台ERP系统打开给徐新看,虽然销售额只有5000万元,但每个月增长10%,京东商城当时还没钱打广告,可老客户一年会上来3次,这几组数据足以证明,用户喜欢这个网站。这组数据的信息量和推演逻辑,足以覆盖一份花哨的项目故事PPT。

因为数据在说话,更因为用户行为累积成的数据信息足以挖掘出产品的可成长性、电商的趋势、盈利模式是否健康等核心信息。而大数据的来源其实是人,玩转大数据,其实是在挖掘人性需求。

大数据更接地气的解释是统计学(包含但不完全),但大数据应用需要从用户行为中摸出统计及定性和定向的脉络,最终形成有价值的信息,以指导产品设计、平台搭建、营销推广等实用策略。数据本身零散的,需要经过清洗、挖掘、组织、归纳,演变成有价值的信息,由此起到决策、佐证、指导的应用价值。

其实,大数据更深层的挖掘就是用户行为(人性)、用户需求(欲望)、转化(选择),把“我”升级成“我们”,换位思考一下行为和欲望,再进行性别、年龄、地域、收入、教育等等深度的信息挖掘,就能理解在纷繁复杂的人类与人性里,数据于此的息息相关了。说白了,大数据就是若干个“我”的存在,而大数据应用,就是在“我们”里挖掘信息,以洞察“我们”的需求,转化成商业模式,实现盈利。对“我们”的玩转,也是电商盈利模式不断升级的过程。

当微信、微博社交媒体成为用户黏度最高的产品时,基于社交圈的用户原始需求也最有效地形成有价值数据:

1、社交平台的信息分享对于个体用户有着强烈的需求煽动力,电商社交化,立刻成为趋势。

2、用户的兴趣点、社交图谱与购买转化形成的时间规律、价格规律、敏感词规律,通过萃取可梳理出一套电商营销方法论,在恰当的时间、恰当的社交平台、以恰当的卖点投放恰当的产品广告,触达用户,形成精细化营销。

而这一系列大数据的有效信息萃取,都是来自若干个“我”。如果还在神乎其神地脱离“我”谈大数据,可以想见的是,没人气。

大数据是随人走的,但产品设计、平台搭建、营销推广,是随大数据应用走的,对人性洞察越犀利,在人与大数据之间的正向转化也就越乐观。电商资料库可以快速捕获、监控、分析用户行为,进行数字化生产和管理。

海量用户行为数据背后,隐藏的就是消费行为逻辑,什么样的广告用户最买单?不同区域的人购买习惯差异是什么?不同年龄与性别的人在不同时期都在消费什么?PC与移动的用户及用户行为差异是什么?这些复杂碎片化的信息,都能从数据中系统地萃取,形成一套方法论。

其本质,依然是在洞察“我”。每一个“我”都是孤立的碎片信息,但是通数据收集、挖掘、清洗、归纳,进行价值数据输出,“我”就升级成“我们”,“我们”就合力成海量需求,海量需求就成为有价值的数据包。通过精准分析、定位、投放,能够让产品设计、平台搭建、营销变得智能、精准、快捷、高效。尊重每一个“我”的存在,是大数据应用从人性及用户行为出发,挖掘有效信息的根本。

未来,数据收集和分析能力的强弱可能决定了企业的核心竞争力。当每一个个体成为大数据构成中的一分子的时候,把自己也作为一个用户样本,真实洞察自身需求和行为,也能从价值观和行为习惯中推理出相唿应的价值信息,放之“我们”中进行匹配和佐证,也算为大数据贡献一个样本了。
  人工智能、大数据、云计算和物联网的未来发展值得重视,均为前沿产业,多智时代专注于人工智能和大数据的入门和科谱,在此为你推荐几篇优质好文:
如何通过自学,成为数据挖掘“高手”?
http://www.duozhishidai.com/article-9796-1.html
数据分析与数据挖掘的区别和联系?
http://www.duozhishidai.com/article-9800-1.html
构建一个数据挖掘模型,主要分为哪几步?
http://www.duozhishidai.com/article-9719-1.html


多智时代-人工智能和大数据学习入门网站|人工智能、大数据、物联网、云计算的学习交流网站

大数据该挖掘,主要挖掘什么,什么是文本挖掘?相关推荐

  1. 医疗大数据的分析和挖掘发展现状以及未来的应用前景

    本文来自网易云社区. 大数据的分析和挖掘在医疗领域的应用包含很多的方向,比如临床操作的比较效果研究.临床决策支持系统.医疗数据透明度.远程病人监控.对病人档案的先进分析:临床试验数据分析.个性化治疗. ...

  2. 专家纵论谈大数据:认清本质 挖掘真价值

    在日前举行的"第十届国家信息化专家论坛"上,众多专家阐述了对"开放数据与大数据发展"的看法. 工业和信息化部副部长杨学山表示,大数据概念的出现让人类社会看到了信 ...

  3. 大数据征信,核心是对大数据的搜集与挖掘

    今年初央行公布八家做好个人征信业务准备工作的机构以来,大数据征信成为行业热议的话题.这方面做的比较好的几家公司中,腾讯旗下的腾讯征信和阿里巴巴旗下的芝麻信用,因为各自掌握中国最大规模的互联网数据而备受 ...

  4. 面对大数据,你能挖掘怎样的未来?

    大数据的用途和形式越来越多,数据分析师在一个公司中的作用也越来越重.积累分析数据固然重要,但目前更为紧迫的问题是:可以从大数据里挖掘到多少可被企业利用的价值? 这次在WE-LINK创业咖啡的大数据商业 ...

  5. 医疗大数据的分析和挖掘发展现状如何?

    医疗数据挖掘近些年非常火爆,相关的论文也层出不穷.我整理了5篇医疗数据挖掘领域的论文,分享给大家,后面附有pdf下载. 另外还给大家准备了<医疗数据挖掘顶会写作方法> 扫码加我,回复&qu ...

  6. 《大数据》2015年第2期“研究”——特异群组挖掘:框架与应用

    特异群组挖掘:框架与应用 熊 赟1,2,朱扬勇1,2 1. 复旦大学计算机科学技术学院 上海 201203: 2. 上海市数据科学重点实验室(复旦大学) 上海 201203 摘要:特异群组挖掘在证券金 ...

  7. 什么是大数据?漫谈大数据仓库与挖掘系统

    什么是大数据?漫谈大数据仓库与挖掘系统 任何比较关注业界新闻的人,都会知道近两年数字信息领域的几个关键字: 移动端.LBS.SNS和大数据(Big Data).前边三个,大家应该是很熟悉的,因为身边早 ...

  8. 图解大数据 | 综合案例-使用Spark分析挖掘零售交易数据

    作者:韩信子@ShowMeAI 教程地址:http://www.showmeai.tech/tutorials/84 本文地址:http://www.showmeai.tech/article-det ...

  9. 明略数据SCOPA发布 开启大数据关联挖掘的新时代

    10月22日,明略数据战略产品发布会在中国大饭店隆重召开,同时也开启了基于数据关系挖掘的大数据智能分析新篇章.此次发布会吸引了众多明略数据的客户.合作伙伴及行业专业人士莅临到场.明略数据董事长吴明辉先 ...

  10. 顶尖技术专家严选,15场前沿论坛思辨,2019中国大数据技术大会邀您共赴

    扫码了解2019中国大数据技术大会(https://t.csdnimg.cn/IaHb)更多详情. 2019中国大数据技术大会(BDTC 2019)将于12月5日-7日在北京长城饭店举办,本届大会将聚 ...

最新文章

  1. Java实现图片裁剪预览功能
  2. 今天有了意外收获,原来还可以这样提交数据的
  3. CFCC百套计划4 Codeforces Round #276 (Div. 1) E. Sign on Fence
  4. java9-6 内部类
  5. sign python_python实现sign签名
  6. 建智能工厂,可从这6个方面着手!
  7. halcon相关的链接
  8. django时区设置问题
  9. 大学计算机网络实验2,河南工业大学计算机网络实验报告2
  10. In static memberfunction
  11. en55032最新标准下载_欧盟新EMC标准EN55032强制实施
  12. 信创办公--基于WPS的Word最佳实践系列(修改标题样式快速实现章前分页效果)
  13. html打印 去除页眉页脚,js客户端打印html并且去掉页眉、页脚
  14. 每日一题860-柠檬水找零
  15. vmware虚拟化故障虚拟磁盘丢失恢复办法
  16. 雷军与小米:上扬的微笑与下行的隐忧
  17. 微软云-Azure使用避坑宝典(1)
  18. 男女Java_梦幻都市-心动男女
  19. JAVA反射----->看这篇就够了
  20. Windows系列原版系统镜像下载

热门文章

  1. EBS财务模块表结构
  2. 我国芯片各细分领域龙头名单
  3. 机器人焊枪动作与编程实验_工业机器人编程实验.doc
  4. 【变压器版图设计】利用ADS生成变压器版图
  5. 反激式开关电源设计_变压器选型
  6. Jmeter接口测试工具安装
  7. Python中机器学习模型的几种保存方式
  8. DelayQueue浮光掠影
  9. 企业微信开发服务端报错汇总(手把手教你企业微信开发五)
  10. photoshop基础操作集合01