GridFS是一种将大型文件存储在MongoDB的文件规范:
数据库支持以BSON格式保存二进制对象。 但是MongoDB中BSON对象最大不能超过4MB。
GridFS 规范提供了一种透明的机制,可以将一个大文件分割成为多个较小的文档。
为实现这点,该规范指定了一个将文件分块的标准。每个文件都将在文件集合对象中保存一个元数据对象,一个或多个块对象可被组合保存在一个块集合中。
文件如何被分块保存的细节可以参看GridFS Specification。
mongo自带有一个实现mongofliles,基本操作如下:
列出所有文件:

mongofiles list

上传一个文件:

mongofiles put xxx.txt

下载一个文件:

mongofiles get xxx.txt

查找文件:

mongofiles search xxx //会查找所有文件名中包含“xxx”的文件
mongofiles list xxx //会查找所有文件名以“xxx”为前缀的文件

参数说明:

–d 指定数据库 ,默认是fs,Mongofiles list –d testGridfs
-u –p 指定用户名,密码
-h 指定主机
-port 指定主机端口
-c 指定集合名,默认是fs   // 这个好像不对
-t 指定文件的MIME类型,默认会忽略   //这个没有测试过

原理:
GridFS在数据库中,默认使用fs.chunks和fs.files来存储文件。
1.fs.files集合存放文件的信息;
2.fs.chunks存放文件数据;

> show collections;  fs.chunks  fs.files  system.indexes  

fs.files集合包含了文件的元数据,而fs.chunks集合则存储实际的以256KB尺寸进行分割的文件块。如果你有分片的集合,那么文件块会分布到多台服务器上,或许能获得比文件系统更好的性能。

> db.fs.files.findOne();  {  "_id" : ObjectId("530cf1bf96038f5cb6df5f39"),  "filename" : "./conn.log",  "chunkSize" : 262144,  "uploadDate" : ISODate("2014-02-25T19:40:47.321Z"),  "md5" : "6515e95f8bb161f6435b130a0e587ccd",  "length" : 1644981  }

MongoDB还在files_id和文件块数中创建了复合索引,以帮助快速访问这些文件块

    > db.fs.chunks.getIndexes();  [{  "v" : 1,"key" : {  "_id" : 1  },  "ns" : "files.fs.chunks",  "name" : "_id_"  },  {  "v" : 1,  "key" : {  "files_id" : 1,  "n" : 1  },  "ns" : "files.fs.chunks",  "name" : "files_id_1_n_1"  }  ]  }

一个fs.files集合中的一条记录内容如下,即一个file的信息如下:

{"_id" : ObjectId("4f4608844f9b855c6c35e298"), //唯一id,可以是用户自定义的类型"filename" : "CPU.txt", //文件名"length" : 778, //文件长度"chunkSize" : 262144, //chunk的大小"uploadDate" : ISODate("2012-02-23T09:36:04.593Z"), //上传时间"md5" : "e2c789b036cfb3b848ae39a24e795ca6", //文件的md5值"contentType" : "text/plain" //文件的MIME类型"meta" : null   //文件的其它信息,默认是没有”meta”这个key,用户可以自己定义为任意BSON对象
}

对应的fs.chunks中的chunk如下:

{"_id" : ObjectId("4f4608844f9b855c6c35e299"), //chunk的id"files_id" : ObjectId("4f4608844f9b855c6c35e298"), //文件的id,对应fs.files中的对象,相当于fs.files集合的外键"n" : 0, //文件的第几个chunk块,如果文件大于chunksize的话,会被分割成多个chunk块"data" : BinData(0,"QGV...")    //文件的二进制数据,这里省略了具体内容
}

默认chunk的大小是256K:

public static final int DEFAULT_CHUNKSIZE = 256 * 1024;

写入:

如果文件大于chunksize,则把文件分割成多个chunk,再把这些chunk保存到fs.chunks中,最后再把文件信息存入到fs.files中。
读取:
先据查询的条件,在fs.files中找到一个合适的记录,得到“_id”的值,再据这个值到fs.chunks中查找所有“files_id”为“_id”的chunk,并按“n”排序,最后依次读取chunk中“data”对象的内容,还原成原来的文件。

自定义Gridfs的hash函数:
尽管从理论上,无论用什么hash函数,都有可能出现hash值相同,但内容不相同的文件,但是对于GridFS默认使用的md5算法,目前已出现长度和md5值都相同但内容不一样的文件。
如果想要自已改用其它hash算法,可以从驱动入手。因为GridFS在MongoDB中实际也只是两个普通的集合,所以完全可以自已修改驱动,替换下hash算法即可。

注意事项:

  1. GridFS不自动处理md5相同的文件,对于md5相同的文件,如果想在GridFS中只有一个存储,要用户自已处理。Md5值的计算由客户端完成。
  2. 因为GridFS在上传文件过程中是先把文件数据保存到fs.chunks,最后再把文件信息保存到fs.files中,所以如果在上传文件过程中失败,有可能在fs.chunks中出现垃圾数据。这些垃圾数据可以定期清理掉。

GridFS的模块

如果你想把存储在MongoDB的GridFS的文件直接服务于Web服务器或文件系统,那么你可以使用下面的GridFS插件:
1)GridFS-Fuse:让GridFS的文件直接服务于文件系统
2)GridFS-Nginx:让GridFS的文件直接服务于Nginx

GridFS的局限性

GridFS也并非十全十美的,它也有一些局限性:
1)工作集
伴随数据库内容的GridFS文件会显著地搅动MongoDB的内存工作集。如果你不想让GridFS的文件影响到你的内存工作集,那么可以把GridFS的文件存储到不同的MongoDB服务器上。
2)性能
文件服务性能会慢于从Web服务器或文件系统中提供本地文件服务的性能。但是这个性能的损失换来的是管理上的优势。
3)原子更新
GridFS没有提供对文件的原子更新方式。如果你需要满足这种需求,那么你需要维护文件的多个版本,并选择正确的版本。

转载于:https://www.cnblogs.com/weloveshare/p/5752000.html

mongodb--GridFS相关推荐

  1. MongoDB GridFS——本质上是将一个文件分割为大小为256KB的chunks 每个chunk里会放md5标识 取文件的时候会将这些chunks合并为一个整体返回...

    MongoDB GridFS GridFS 用于存储和恢复那些超过16M(BSON文件限制)的文件(如:图片.音频.视频等). GridFS 也是文件存储的一种方式,但是它是存储在MonoDB的集合中 ...

  2. MongoDB GridFS 存储文件

    使用MongoDB的GridFS方式. CSDN: https://blog.csdn.net/qq_32657967/article/details/81534259 官方文档: https://d ...

  3. 一文说通Dotnet操作MongoDB GridFS

    补个技术债.   这个主题一直在列表中,今天把它补上.还有一个原因,就是网上能查到的代码,大多已经过期了.今天写的,是按最新的SDK做的例子.   一.MongoDB GridFS 先说说 GridF ...

  4. 从MongoDB GridFS流式传输文件

    不久前,我在Twitter上发布了自己的最新作品,即从MongoDB GridFS传输文件进行下载(而不是将整个文件存储到内存中然后提供服务),这是我取得的一个小胜利. 我答应就此事写博客,但不幸的是 ...

  5. PHP操作MongoDB GridFS 存储文件

    PHP操作MongoDB GridFS 存储文件,如图片文件 我的测试代码: 1.前端上传文件html index.html <!DOCTYPE html PUBLIC "-//W3C ...

  6. Python 分布式文件系统 Mongodb GridFS

    Python 分布式文件系统 Mongodb GridFS~~~~ 抽时间关注下~~~ 转载于:https://www.cnblogs.com/macula7/archive/2010/03/31/1 ...

  7. MongoDB——GridFS

    MongoDB GridFS GridFS 用于存储和恢复那些超过16M(BSON文件限制)的文件(如:图片.音频.视频等). GridFS 也是文件存储的一种方式,但是它是存储在MonoDB的集合中 ...

  8. SpringBoot+MongoDB GridFS文件上传、下载、预览实战

    SpringBoot + MongoDB GridFS 随着web 3.0的兴起,数据的形式不局限于文字,还有语音.视频.图片等.高效存储与检索二进制数据也成为web 3.0必须要考虑的问题.然而这种 ...

  9. Python+Streamlit aggrid+MongoDB GridFS构建低代码文档管理应用(文档查询下载实用篇)

    1. Sreamlit aggrid简介 Sreamlit aggrid是Streamlit的Ag-Grid组件的实现,在Python Streamlit框架下,更加灵活的使用表格,包括分组.排序.编 ...

  10. mongodb gridfs java_mongodb gridfs基本使用

    Mongodb GridFS图片文件存储解决方案 之前解决方案是接收图片数据后,将图片直接存储到盘阵,然后通过Apache做服务器,将图片信息存储到数据库,并且存储一个Apache的访问路径. 目前需 ...

最新文章

  1. java a3 套打印_Java - apache PDFBox兩個A3論文到一個A2?
  2. linux centos 分区,linux centos 分区
  3. jQuery的三种bind/One/Live/On事件绑定使用方法
  4. 数组之间的计算matlab,matlab中的矩阵运算和数组运算方法
  5. linux下.a/.so/.la目标库区别
  6. 51单片机雾化片自动扫频程序_单片机简介
  7. MongoDB (六) MongoDB 集合操作
  8. Linux的watch命令 -- 实时监测命令的运行结果
  9. 中文手册_Etherscan API中文手册
  10. python装饰器详解-python 装饰器详解
  11. python自带intertool模块找不到_Python itertools模块详解
  12. javascript array map方法
  13. 浏览器静态资源的缓存机制(http强缓存 协商缓存)
  14. 软回车和硬回车的区别
  15. word文档通配符换行_Word怎么批量删除分隔符
  16. 红外近距空空导弹弹道仿真
  17. 《SSO系列二》自己动手写一个SSO
  18. 字符串,字符数组的初始化
  19. 移动互联网如何改变了外卖行业
  20. 云计算供应商的分类及代表厂商

热门文章

  1. 删表出现mysql错误1051_无法删除mySQL表. (错误1050)
  2. 如何debug函数_如何使用 pdb 来性感 debug 你的 Python 代码?
  3. yum 错误:Invalid configuration value: failovermethod=priority
  4. 【uni-app】动态计算图片高度且保持宽高比
  5. 【uniapp】Error during WebSocket handshake: Unexpected response code: 302
  6. 【Get 以太坊技能】CentOS 7 Geth安装
  7. 什么叫大地高_涨得高不是不买的理由,更不是卖出的理由,什么叫追涨杀跌?(附最简单选股方法)---交易那些事儿...
  8. python自关联_Django之Mode的外键自关联和引用未定义的Model方法
  9. php分布式数据一致性,如何解决分布式系统数据事务一致性问题
  10. 限定概率抽奖_圣诞节LOL紫色宝箱30连抽,限定全是冰雪,节日气氛很浓