GridFS是一种将大型文件存储在MongoDB的文件规范:

数据库支持以BSON格式保存二进制对象。 但是MongoDB中BSON对象最大不能超过4MB。
GridFS 规范提供了一种透明的机制,可以将一个大文件分割成为多个较小的文档。
为实现这点,该规范指定了一个将文件分块的标准。每个文件都将在文件集合对象中保存一个元数据对象,一个或多个块对象可被组合保存在一个块集合中。

文件如何被分块保存的细节可以参看GridFS Specification。

mongo自带有一个实现mongofliles,基本操作如下:
  1. 列出所有文件:
  2. mongofiles list
  3. 上传一个文件:
  4. mongofiles put xxx.txt
  5. 下载一个文件:
  6. mongofiles get xxx.txt
  7. 查找文件:
  8. mongofiles search xxx //会查找所有文件名中包含“xxx”的文件
  9. mongofiles list xxx //会查找所有文件名以“xxx”为前缀的文件
  10. 参数说明:
  11. –d 指定数据库 ,默认是fs,Mongofiles list –d testGridfs
  12. -u –p 指定用户名,密码
  13. -h 指定主机
  14. -port 指定主机端口
  15. -c 指定集合名,默认是fs // 这个好像不对
  16. -t 指定文件的MIME类型,默认会忽略 //这个没有测试过

原理:
GridFS在数据库中,默认使用fs.chunks和fs.files来存储文件。
1.fs.files集合存放文件的信息;
2.fs.chunks存放文件数据;

  1. > show collections;
  2. fs.chunks
  3. fs.files
  4. system.indexes
  5. >
fs.files集合包含了文件的元数据,而fs.chunks集合则存储实际的以256KB尺寸进行分割的文件块。如果你有分片的集合,那么文件块会分布到多台服务器上,或许能获得比文件系统更好的性能。

  1. > db.fs.files.findOne();
  2. {
  3. "_id" : ObjectId("530cf1bf96038f5cb6df5f39"),
  4. "filename" : "./conn.log",
  5. "chunkSize" : 262144,
  6. "uploadDate" : ISODate("2014-02-25T19:40:47.321Z"),
  7. "md5" : "6515e95f8bb161f6435b130a0e587ccd",
  8. "length" : 1644981
  9. }
  10. >
MongoDB还在files_id和文件块数中创建了复合索引,以帮助快速访问这些文件块
  1. > db.fs.chunks.getIndexes();
  2. [
  3. {
  4. "v" : 1,
  5. "key" : {
  6. "_id" : 1
  7. },
  8. "ns" : "files.fs.chunks",
  9. "name" : "_id_"
  10. },
  11. {
  12. "v" : 1,
  13. "key" : {
  14. "files_id" : 1,
  15. "n" : 1
  16. },
  17. "ns" : "files.fs.chunks",
  18. "name" : "files_id_1_n_1"
  19. }
  20. ]
  21. >



一个fs.files集合中的一条记录内容如下,即一个file的信息如下:
  1. {
  2. "_id" : ObjectId("4f4608844f9b855c6c35e298"), //唯一id,可以是用户自定义的类型
  3. "filename" : "CPU.txt", //文件名
  4. "length" : 778, //文件长度
  5. "chunkSize" : 262144, //chunk的大小
  6. "uploadDate" : ISODate("2012-02-23T09:36:04.593Z"), //上传时间
  7. "md5" : "e2c789b036cfb3b848ae39a24e795ca6", //文件的md5值
  8. "contentType" : "text/plain" //文件的MIME类型
  9. "meta" : null //文件的其它信息,默认是没有”meta”这个key,用户可以自己定义为任意BSON对象
  10. }
对应的fs.chunks中的chunk如下:
  1. {
  2. "_id" : ObjectId("4f4608844f9b855c6c35e299"), //chunk的id
  3. "files_id" : ObjectId("4f4608844f9b855c6c35e298"), //文件的id,对应fs.files中的对象,相当于fs.files集合的外键
  4. "n" : 0, //文件的第几个chunk块,如果文件大于chunksize的话,会被分割成多个chunk块
  5. "data" : BinData(0,"QGV...") //文件的二进制数据,这里省略了具体内容
  6. }
默认chunk的大小是256K:
public static final int DEFAULT_CHUNKSIZE = 256 * 1024;

写入:
如果文件大于chunksize,则把文件分割成多个chunk,再把这些chunk保存到fs.chunks中,最后再把文件信息存入到fs.files中。
读取:
先据查询的条件,在fs.files中找到一个合适的记录,得到“_id”的值,再据这个值到fs.chunks中查找所有“files_id”为“_id”的chunk,并按“n”排序,最后依次读取chunk中“data”对象的内容,还原成原来的文件。

自定义Gridfs的hash函数:
尽管从理论上,无论用什么hash函数,都有可能出现hash值相同,但内容不相同的文件,但是对于GridFS默认使用的md5算法,目前已出现长度和md5值都相同但内容不一样的文件。
如果想要自已改用其它hash算法,可以从驱动入手。因为GridFS在MongoDB中实际也只是两个普通的集合,所以完全可以自已修改驱动,替换下hash算法即可。


注意事项:
1. GridFS不自动处理md5相同的文件,对于md5相同的文件,如果想在GridFS中只有一个存储,要用户自已处理。Md5值的计算由客户端完成。
2. 因为GridFS在上传文件过程中是先把文件数据保存到fs.chunks,最后再把文件信息保存到fs.files中,所以如果在上传文件过程中失败,有可能在fs.chunks中出现垃圾数据。这些垃圾数据可以定期清理掉。

四、GridFS的模块
如果你想把存储在MongoDB的GridFS的文件直接服务于Web服务器或文件系统,那么你可以使用下面的GridFS插件:
1)GridFS-Fuse:让GridFS的文件直接服务于文件系统
2)GridFS-Nginx:让GridFS的文件直接服务于Nginx
 
五、GridFS的局限性
GridFS也并非十全十美的,它也有一些局限性:
1)工作集
伴随数据库内容的GridFS文件会显著地搅动MongoDB的内存工作集。如果你不想让GridFS的文件影响到你的内存工作集,那么可以把GridFS的文件存储到不同的MongoDB服务器上。
2)性能
文件服务性能会慢于从Web服务器或文件系统中提供本地文件服务的性能。但是这个性能的损失换来的是管理上的优势。
3)原子更新
GridFS没有提供对文件的原子更新方式。如果你需要满足这种需求,那么你需要维护文件的多个版本,并选择正确的版本。



最新文章

  1. filefiter
  2. WinForm------字段不能为空错误
  3. python27+django1.9添加api
  4. JQuery向ashx提交中文参数方案
  5. 算法基础:最大递减数问题(Golang实现)
  6. codeforces D.Mashmokh and ACM
  7. Android全屏显示
  8. 2014年2月5日 Oracle ORACLE的工作机制[转]
  9. freemarker定义一个连续的序列
  10. 杭电ACM2022--发工资咯:)
  11. ios 上下滑动粘滞问题
  12. 【详记MySql问题大全集】三、安装之后没有my.ini配置文件怎么办
  13. LeetCode算法题-Power of Four(Java实现-六种解法)
  14. 利用lnmp一键安装的php环境忘记mysql,root用户密码解决方法
  15. C# Winform ListView控件
  16. linux代码常用查询!!!!!!!!!!!!
  17. MySQL——SQL Mode详解
  18. PHP 使用memcached
  19. 检查用户输入信息是否完整(vb.net实现)
  20. php之trait 个人笔记

热门文章

  1. log4j输出多个自定义日志文件,动态配置路径
  2. BA-闭式冷却塔系统
  3. Fibbonacci Number(杭电2070)
  4. Android之应用开发基础
  5. angularjs1-过滤器
  6. 使用神经网络-垃圾邮件检测-LSTM或者CNN(一维卷积)效果都不错【代码有问题,pass】
  7. Java-SpringCloud:Spring Cloud 是什么
  8. web前端简单布局
  9. tomcat开启https服务
  10. Oracle 复合索引设计原理——前缀性和可选性