作者 | CDA数据分析师

Tableau内置的连接器可以连接到所有常用的数据源。

数据连接器

目前可以连接70多种数据源,分为本地连接和服务器连接。 Tableau支持的本地连接包括Excel、txt、csv、json等各类常见的源数据格式,还支持多种空间文件, 为使用地图分析提供了条件。

Tableau支持的服务连接包括各类数据库(如Mysql、Oracle、MongoDB)、在线数据服务(如google analtics)等,可以根据使用需要,与目标服务器建立连接关系。

如果以上提供的连接不满足您的需求,可以选择使用“其他数据库 (ODBC)”或“Web 数据连接器”创建自己的连接。

设置数据源

Tableau数据源是数据与Tableau之间的链接,本质上是数据、连接信息以及基于数据进行的自定义操作的总和。

数据源包含:

有关数据存储位置的信息,例如文件名和路径或网络位置。

有关如何连接到数据的详细信息,例如数据库服务器名称和服务器登录信息。

连接中任何表的名称,以及有关各个表如何相互关联的信息。

基于数据进行的自定义,例如计算、组和重命名字段等。

本地文件连接

打开Tableau Desktop进入数据连接界面,在连接到文件中选择要连接的文件类型。这里以Excel文件为例,单击“Microsoft Excel”在弹出的“打开”对话框中找到想要连接的文件。

双击或拖动表名至画布区,下方会显示数据预览。

数据库连接

在数据连接界面,连接到服务器中选择要连接的服务器。这里以“MySQL”为例,单击“MySQL”在弹出“MySQL”对话框输入服务器IP、端口号、用户名及密码即可登录到MySQL服务器。

建立连接后,在数据库列表中选择要连接的数据库,下方会显示当前数据库下可用的工作表。双击或拖动表名至画布区,下方会显示数据预览。

也可以双击或拖动“新自定义SQL”至画布区,输入SELECT语句以连接想要的数据。

剪贴板粘贴

在数据源选择好目标数据,并进行复制操作(Ctrl+C )。

打开tableau,在连接窗口进行粘贴操作(Ctrl+V )。

数据导入成功,tableau跳转到数据源页面。

组合数据源

在一个工作簿中可以同时创建不同的数据连接。

连接到MySQL数据库后,点击“添加”在弹出的“添加连接”对话框中单击“文本文件”,在弹出的“打开”对话框中找到想要连接的文件。

选择不同连接下的数据表先后双击或拖放至画布区,建立不同数据源下的表联结关系。

数据联结

当需要从多个数据表中获取数据时,则要用到数据联接操作。这里以两表联结为例,以两个表的共有字段作为关键字段来建立联结关系。 为了简单直观的操作演示,本文使用自制的Excel数据集demo,文件中包含table1和table2两个数据表。

联结方式

Tableau中支持四种联结方式:内联接、左联接、右联接和完全外部联接。通常情况,Tableau会自动判断两张表的关键字段并进行关联,如果关联不正确或关键字段不一致无法自动关联,可以手动进行关联。

内联结:仅保留两个数据表中具有相同关键字段的行。

左联结:包含左侧表中所有值以及右侧表中相对应的匹配值,如果右侧表中没有与左侧表相匹配的项,则会显示为null。

右联结:包含右侧表中所有值以及左侧表中相对应的匹配值,如果左侧表中没有与右侧表相匹配的项,则会显示为null。

完全外部联接:包含两个表中的所有值,如果一张表的值在另一张表中没有匹配项,则显示为null。

数据合并

当需要将有多个结构一致的数据表整合汇总在一起时,则可以使用数据合并。数据联接是横向扩展,数据合并是纵向增加。 进行数据合并的要求是,每个数据表的==字段名、个数、顺序和数据类型必须完全一致==。 为了简单直观的操作演示,本文使用自制的Excel数据集demo,文件中包含三个数据表。

手动数据合并

双击或拖放“新建并集”至画布区,将需要合并的数据表拖入弹出的并集(手动)对话框。

合并后的数据表包含三个数据表的所有数据,并且各字段一一对应。需要注意的是,新增了sheet和table name两个字段,用于说明并集中的值的来源。

自动数据合并

双击或拖放“新建并集”至画布区,在弹出的“并集”对话框中选择“通配符(自动)”。 在“工作表”位置,将匹配内容改写为“班”,其中“班”是共有的名称,是通配符,用于匹配三个工作表。

合并后的数据表包含三个数据表的所有数据,并且各字段一一对应。需要注意的是,新增了path、sheet两个字段,用于说明并集中的值的来源路径及表名称。

数据连接方式

与数据源完成连接后,将数据表拖放至画布区,就可以在画布区看到“连接”方式的选择,分别是“实时”和“数据提取”。 实时:直接从数据源实时查询获取数据信息,Tableau不对源数据进行存储。 数据提取:将数据源的数据保存到本地计算机,大幅缩短Tableau查询载入源数据的时间。

为什么有两种连接方式

因为很多时候数据源的数据量很大,如果我们选择实时连接,会严重影响计算机的运行效率和性能。因此提供了数据提取的功能,可以只提取小部分数据到本地,开发完毕部署的时候,再选择实时连接获取全部最新的数据。

使用数据提取会在本地创建一个数据源的副本,然后可以在其他计算机上继续我们的工作,也可以把打包工作簿分享给那些无法直接访问数据源的用户。

数据提取

数据提取是保存的数据子集。 在创建数据的数据提取时,可以通过使用筛选器和配置其他限制来减少数据总数。 创建数据提取后,可使用原始数据中的数据对其进行刷新。在刷新数据时,可以选择进行完全刷新或增量刷新。 完全刷新:默认方式,每次都会重新获取数据源的数据,创建的本地副本与数据源一致。 增量刷新:仅刷新自上次数据提取后新增的行。

数据提取的优势

支持大型数据集:可以创建包含数十亿行数据的数据提取。

快速创建:如果使用大型数据集,则创建和使用数据提取可能比使用原始数据更快。

帮助提高性能:数据提取会在本地创建数据源的副本,不受服务器性能及网络的影响,大大提高了运行效率。

支持附加功能:数据提取可以利用原始数据不支持的Tableau功能,例如不重复计数计算功能。

提供对数据的离线访问权限:当原始数据不可用时,数据提取允许在本地保存和处理数据。

创建数据提取

选择数据提取后,会显示“编辑”和“刷新”按钮。单击“编辑”在弹出的“数据提取”对话框中设置数据提取的要求。

指定在数据提取中存储数据的方式

单个表:用于存储数据提取数据的默认结构,当使用数据提取筛选器、聚合、前 N 个等,可以使用“单个表”存储数据。

多个表:当表之间的所有联结均为等值 (=) 联结,联结关键字段的数据类型完全相同,未使用直通函数 (RAWSQL),未配置增量刷新、数据提取筛选器、“前 N 个”或抽样的情况下,可以使用“多个表”方式存储数据提取。

PS:“单个表”和“多个表”选项只会影响数据提取中数据的存储方式,不影响数据提取中的表在“数据源”页面上的显示方式。 假设您的数据提取由三个表组成。如果直接打开配置为使用默认选项“单个表”的数据提取 (.hyper) 文件,在“数据源”页面上只会显示一个表。但是,如果打开使用打包数据源 (.tdsx) 文件的数据提取或包含其对应数据提取 (.hyper) 文件的数据源 (.tdsx) 文件,在“数据源”页面上可以看到包含数据提取的全部三个表。

指定要提取的数据量

筛选器:添加一个或多个筛选器,基于字段及字段值限制提取的数据量。

聚合:选择“聚合可视维度的数据”以使用度量的默认聚合,对数据进行聚合来合并行,可以最大限度地减少数据提取文件的大小并提高性能。 选择对数据进行聚合时,也可以选择按指定的日期级别(例如“年”、“月”等)来“汇总日期”。

行数:可以提取所有行或前N行。Tableau首先会应用筛选器和聚合,然后从经过筛选和聚合的结果中提取行数。 并非所有数据源都支持抽样。因此,在“提取数据”对话框中可能会看不到“抽样”选项。 数据提取中将不包括最初在“数据源”页面或工作表标签页中隐藏的任何字段。单击“隐藏所有未使用的字段”按钮可将这些隐藏字段从数据提取中移除。

设置完成后,单击工作表标签页可启动数据提取创建过程。在随后显示的对话框中,选择一个用于保存数据提取的位置,为该数据提取文件指定名称,然后单击“保存”即可。

在抽样数据与整个数据提取之间切换

当您使用大型数据提取时,您可能需要创建一个带数据样本的数据提取,以便每次将字段放在工作表标签页中的功能区上时,您都可以设置视图,同时避免长时间查询。然后,可以在使用带数据样本的数据提取和使用整个数据源之间进行切换,方法是在“数据”菜单中选择数据源,然后选择“使用数据提取”。

实时和数据提取的选择

什么情况下选择“实时”

源数据的保密性要求较高,处于安全考虑不希望保存到本地时,可以采取实时连接的方式。

需要实时更新源数据信息,并且对实时性的要求较高时,可以选择实时连接的方式。

什么情况下选择“数据提取”

不便于实时连接数据源,如数据是通过本地服务器获取,但又需要在别的电脑进行分析时,可以通过”数据提取“将所需分析的数据保存到本地电脑。

分析的数据量较大,需要提高数据载入效率,降低源数据库的访问压力时,可以通过数据提取将数据转移到本地计算机。

想要获取更多新鲜资讯和优质内容,可搜索进入我们的CDA小程序,不要错过了哟...

tableau两个不同的图合并_tableau两个不同的图合并_Tableau数据源详解相关推荐

  1. python二维图颜色函数_通过python改变图片特定区域的颜色详解

    通过python改变图片特定区域的颜色详解 首先让我祭出一张数学王子高斯的照片,这位印在德国马克上的神人有多牛呢? 他是近代数学的奠基人之一,与牛顿, 阿基米德并称顶级三大数学家,随便找一个编程语言的 ...

  2. 开启子进程的两种方式、进程间内存空间隔离、进程对象的方法或属性详解

    1.操作系统(推荐查看书籍:现代操作系统)     操作系统是位于计算机硬件与软件之间的控制程序     作用:         1.将硬件的复杂操作封装成简单的接口,给用户或者应用程序使用      ...

  3. 怎样在两个局域网内共享一台打印机 。常用网络命令及命令实例详解

    怎样在两个局域网内共享一台打印机 怎样在两个局域网内共享一台打印机 我们公司有两间办公室,原先布线的时候用一个路由器延伸出多个接口预埋在墙里并做上插头,IP地址是自动分配的,网关是192.168.0. ...

  4. Unity ShaderLab特效教程 适用于贴图、sprite和ugui的2d着色器实例 代码+详解注释 【将贴图转为马赛克效果】

    如果代码中有什么不清楚请查看以下基础知识 Shader基础知识 unity3d 中 七种坐标知识详解 一个将贴图转为马赛克效果的shader: 万恶的马赛克其实也是一种艺术风格,如果你在开发2d游戏不 ...

  5. Unity ShaderLab特效教程 适用于贴图、sprite和ugui的2d着色器实例 代码+详解注释 【锐化效果】

    如果代码中有什么不清楚请查看以下基础知识 Shader基础知识 unity3d 中 七种坐标知识详解 锐化效果 笑狗图 代码 Shader "Custom/BlurBox" {Pr ...

  6. Unity ShaderLab特效教程 适用于贴图、sprite和ugui的2d着色器实例 代码+详解注释 【2d流光边框效果】

    如果代码中有什么不清楚请查看以下基础知识 Shader基础知识 unity3d 中 七种坐标知识详解 2d流光边框效果 可以自定义边框的高和宽,流光尺寸和速度以及中心点 笑狗图: 代码 Shader ...

  7. java 线程 状态 图_Java线程中的生命周期和状态控制图文详解

    这篇文章主要介绍了Java线程的生命周期和状态控制,需要的朋友可以参考下 一.线程的生命周期 线程状态转换图: 1.新建状态 用new关键字和Thread类或其子类建立一个线程对象后,该线程对象就处于 ...

  8. 华硕h81m一k跳线图_主板跳线接法的所有秘密图文详解(适合新手)

    作为一名新手,要真正从头组装好自己的电脑并不容易,也许你知道CPU应该插哪儿,内存应该插哪儿,但遇到一排排复杂跳线的时候,很多新手都不知道如何下手.钥匙开机其实并不神秘 还记不记得你第一次见到装电脑的 ...

  9. win7定时关机命令_电脑两个小技巧:新手设置电脑定时关机 VS 定时开机的方法详解!...

    关于电脑使用小技巧,我们之前也分享过不少,有朋友在后台问,如果用命令设置电脑的开机关机,今天李哥就跟大家来详细说说这个问题.定时关机:关于电脑定时关机可能还有很多小伙伴不知道这个功能,当然也肯定也不清 ...

  10. python两个装饰器执行顺序_python中多个装饰器的执行顺序详解

    装饰器是程序开发中经常会用到的一个功能,也是python语言开发的基础知识,如果能够在程序中合理的使用装饰器,不仅可以提高开发效率,而且可以让写的代码看上去显的高大上^_^ 使用场景 可以用到装饰器的 ...

最新文章

  1. linux grouplist groupinstall groupremove 简介
  2. C#最基本的小说爬虫
  3. 安装qgis显示python错误_ArcGIS 与 QGIS 3 冲突的解决方案
  4. 统一返回的json时间格式
  5. java.policy无法修改_如何配置Policy文件进行Java安全策略的设置
  6. 【剑指 offer】(十)—— 二进制形式 1 的个数
  7. delphi 中assert
  8. Python程序的采样分析神器py-spy模块实践
  9. 第四届泰迪杯数据挖掘挑战赛B题数据预处理-数据导入(Matlab)
  10. 正确理解文件与目录的可读、可写、可执行权限
  11. 最新版苹果手机html5摇一摇,iphone微信摇一摇失效问题解决
  12. 空间后方交会编程c语言,C语言空间后方交会源代码.doc
  13. 可编程式坐标--单位圆坐标
  14. elementary OS 5 Juno (Pantheon) 安装后配置总结(干货很多)
  15. 特斯拉Tesla Model 3整体架构解析
  16. 74HC165并转串级联芯片学习记录
  17. 一二线城市知名 IT互联网公司名单(最新整理版跳槽名单)~
  18. 如何将图片清晰度变高?电脑怎么调照片清晰度?
  19. Esp8266进阶之路17 esp8266自研的快速上电开关五次 (开-关为一次) ,无需按键触发则8266进去一键配网模式。(附带Demo)
  20. 从苏宁电器到卡巴斯基(第二部)第11篇:我在卡巴的日子 XI

热门文章

  1. 【codejam_Round1B_C】Mousetrap
  2. 可移动存储的设备格式化 - 文件系统
  3. 2008服务器系统c盘清理,WindowsServer2008清理C盘空间
  4. 8年SQL,我换了5次职业方向
  5. 【云服务器安全加固】
  6. 在线生成透明ICO图标
  7. Pycharm处理 E501 line too long 警告
  8. IPA-蛋白质组、代谢组、转录组分析利器
  9. 如何在Excel里输入能打钩的选择框?
  10. 笔记 GWAS 操作流程2-1:缺失质控