一、故障描述

  1、设备清单

设备名称

设备型号

数量

HP FC存储

HP MSA2000

1

450G SAS.硬盘

8

  2、故障描述

  整个存储空间由8块450GB SAS的硬盘组成,其中7块硬盘组成一个RAID5的阵列,剩余1块做成热备盘使用。由于RAID5阵列中出现2块硬盘损坏,而此时只有一块热备盘成功激活,因此导致RAID5阵列瘫痪,上层LUN无法正常使用。

  二、检测磁盘

  由于存储是因为RAID阵列中某些磁盘掉线,从而导致整个存储不可用。因此接收到磁盘后先对所有磁盘做物理检测,检测完后发现没有物理故障。接着使用坏道检测工具检测磁盘坏道,发现也没有坏道。磁盘坏道检测日志如下图:

  三、备份数据

  考虑到数据的安全性以及可还原性,在做数据恢复之前需要对所有源数据做备份,以防其他原因导致数据无法再次恢复。使用dd命令或winhex工具将所有磁盘都镜像成文件。备份完部分数据如下图:

  四、故障分析

  1、分析故障原因

  由于前两个步骤并没有检测到磁盘有物理故障或者是坏道,由此推断可能是由于某些磁盘读写不稳定导致故障发生。因为HP MSA2000控制器检查磁盘的策略很严格,一旦某些磁盘性能不稳定,HP MSA2000控制器就认为是坏盘,就将认为是坏盘的磁盘踢出RAID组。而一旦RAID组中掉线的盘到达到RAID级别允许掉盘的极限,那么这个RAID组将变的不可用,上层基于RAID组的LUN也将变的不可用。目前初步了解的情况为RAID组的LUN有6个,均分配给HP-Unix小机使用,上层做的LVM逻辑卷,重要数据为Oracle数据库及OA服务端。

  2、分析RAID组结构

  HP MSA2000存储的LUN都是基于RAID组的,因此需要先分析底层RAID组的信息,然后根据分析的信息重构原始的RAID组。分析每一块数据盘,发现4号盘的数据同其它数据盘不太一样,初步认为可能是hot Spare盘。接着分析其他数据盘,分析Oracle数据库页在每个磁盘中分布的情况,并根据数据分布的情况得出RAID组的条带大小,磁盘顺序及数据走向等RAID组的重要信息。

  3、分析RAID组掉线盘

  根据上述分析的RAID信息,尝试通过北亚自主开发的RAID虚拟程序将原始的RAID组虚拟出来。但由于整个RAID组中一共掉线两块盘,因此需要分析这两块硬盘掉线的顺序。仔细分析每一块硬盘中的数据,发现有一块硬盘在同一个条带上的数据和其他硬盘明显不一样,因此初步判断此硬盘可能是最先掉线的,通过北亚自主开发的RAID校验程序对这个条带做校验,发现除掉刚才分析的那块硬盘得出的数据是最好的,因此可以明确最先掉线的硬盘了。

  4、分析RAID组中的LUN信息

  由于LUN是基于RAID组的,因此需要根据上述分析的信息将RAID组最新的状态虚拟出来。然后分析LUN在RAID组中的分配情况,以及LUN分配的数据块MAP。底层有6个LUN,因此只需要将每一个LUN的数据块分布MAP提取出来。然后针对这些信息编写相应的程序,对所有LUN的数据MAP做解析,然后根据数据MAP并导出所有LUN的数据。

  五、LVM逻辑卷及VXFS文件系统修复

  1、解析LVM逻辑卷

  分析生成出来的所有LUN,发现所有LUN中均包含HP-Unix的LVM逻辑卷信息。尝试解析每个LUN中的LVM信息,发现其中一共有三套LVM,其中45G的LVM中划分了一个LV,里面存放OA服务器端的数据,190G的LVM中划分了一个LV,里面存放临时备份数据。剩余4个LUN组成一个2.1T左右的LVM,也只划分了一个LV,里面存放Oracle数据库文件。编写解释LVM的程序,尝试将每套LVM中的LV卷都解释出来,但发现解释程序出错。

  2、修复LVM逻辑卷

  仔细分析程序报错的原因,安排开发工程师debug程序出错的位置,并同时安排高级文件系统工程师对恢复的LUN做检测,检测LVM信息是否会因存储瘫痪导致LVM逻辑卷的信息损坏。经过仔细检测,发现确实因为存储瘫痪导致LVM信息损坏。尝试人工对损坏的区域进行修复,并同步修改程序,重新解析LVM逻辑卷。

  3、解析VXFS文件系统

  搭建HP-Unix环境,将解释出来的LV卷映射到HP-Unix,并尝试Mount文件系统。结果Mount文件系统出错,尝试使用“fsck –F vxfs” 命令修复vxfs文件系统,但修复结果还是不能挂载,怀疑底层vxfs文件系统的部分源数据可能被破坏,需要进行手工修复。

  4、修复VXFS文件系统

  仔细分析解析出来的LV,并根据VXFS文件系统的底层结构校验此文件系统是否完整。分析发现底层VXFS文件系统果然有问题,原来当时存储瘫痪的同时此文件在系统正在执行IO操作,因此导致部分文件系统源文件没有更新以及损坏。人工对这些损坏的源文件进行手工修复,保证VXFS文件系统能够正常解析。再次将修复好的LV卷挂载到HP-Unix小机上,尝试Mount文件系统,文件系统没有报错,成功挂载。

  六、检测Oracle数据库文件并启动数据库

  1、恢复所有用户文件

  在HP-Unix机器上mount文件系统后,将所有用户数据均备份至指定磁盘空间。所有用户数据大小在1.2TB左右。部分文件目录截图如下:

  2、检测数据库文件是否完整

  使用Oracle数据库文件检测工具“dbv”检测每个数据库文件是否完整,发现并没有错误。再使用北亚自主研发的Oracle数据库检测工具(检验更严格),发现有部分数据库文件和日志文件校验不一致,安排高级数据库工程师对此类文件进行修复,并再次校验,直到所有文件校验均完全通过。

  3、启动Oracle数据库

  由于我们提供的HP-Unix环境没有此版本的Oracle数据,因此和用户协调将原始生成环境带至北亚数据恢复中心,然后将恢复的Oracle数据库附加到原始生产环境的HP-Unix服务器中,尝试启动Oracle数据库,Oracle数据库启动成功。部分截图如下:

  七、数据验证

  由用户方配合,启动Oracle数据库,启动OA服务端,在本地笔记本安装OA客户端。通过OA客户端对最新的数据记录以及历史数据记录进行验证,并且有用户安排远程不同部门人员进行远程验证。最终数据验证无误,数据完整,数据恢复成功。

  八、移交数据

  用户方重新购买了8块HP-MSA2000原厂硬盘,由北亚工程师配合重新对HP-MSA2000存储进行配置。创建和原始一样的Volume,并将恢复的数据全部复制到重新配置好的存储中,并验证所有服务能够正常启动,包括Oracle数据库服务,OA服务端等。

  九、数据恢复结论

  由于故障发生后保存现场环境良好,没做相关危险的操作,对后期的数据恢复有很大的帮助。整个数据恢复过程中虽然遇到好多技术瓶颈,但也都一一解决。最终在预期的时间内完成整个数据恢复,恢复的数据用户方也相当满意。

  十、项目成员列表

工程师

姓名

电话

邮箱

商务

张晓娜

185,1528,3863

zxn#frombyte.com

项目主管

邓奇

185,1528,3878

dq#frombyte.com

存储工程师

邓奇

185,1528,3878

dq#frombyte.com

RAID工程

宋国建

185,1528,3861

songguojian#frombyte.com

开发工程师

秦颖吉

185,1528,3871

qyj#frombyte.com

文件系统工程师

宋国建

185,1528,3861

songguojian#frombyte.com

审核工程师

张宇

  工程师职能:

  商务工程师:负责反馈消息给用户

  初检工程师:负责设备初检事宜

  实施工程师:负责设备数据安全救援事宜

  审核工程师:负责每一步流程审核

某公司数据恢复报告书相关推荐

  1. 某医药公司北亚数据恢复报告书

    一.故障描述 1.设备清单 设备名称 设备型号 数量 HP-EVA4400控制器 AG638-53011 1 HP-EVA4400扩展柜 AG638-63001 3 HP-FC磁盘 300G FC硬盘 ...

  2. 硬盘开盘数据恢复-不能不学的硬盘基本知识

    最近公司接到的数据恢复案件中有很多都是硬盘硬件损坏导致的数据丢失,由于最近进行的硬盘数据恢复的案例比较多,所以为大家整理了一篇关于硬盘开盘数据恢复的成功率分析和硬盘损坏的简单应对方法,同时无论是台式机 ...

  3. 【案例分析】服务器数据恢复

    服务器数据恢复环境: IBM某型号服务器,安装VMware虚拟主机: 柏科某系列存储,存放虚拟机文件: VMware ESXi 5.5版本操作系统: 虚拟机操作系统:Windows Server 20 ...

  4. 【服务器数据恢复】华为某型号服务器raid6数据恢复案例

    服务器数据恢复环境: 华为某品牌服务器: 10块硬盘组成raid6: EXT3文件系统,划分2个lun. 服务器故障&分析: 服务器在工作过程中raid6瘫痪不可用,管理员对故障服务器的rai ...

  5. 关于硬盘不可不知的基础知识-硬盘开盘修复

    最近公司接到的数据恢复案件中有很多都是硬盘硬件损坏导致的数据丢失,由于最近进行的硬盘数据恢复的案例比较多,所以为大家整理了一篇关于硬盘开盘数据恢复的成功率分析和硬盘损坏的简单应对方法,同时无论是台式机 ...

  6. 企业数据无忧 飞客功不可没

    本文讲的是企业数据无忧 飞客功不可没,在信息高速发展的时代,数据安全是企业最关心的话题,数据丢失.数据泄密通常会对企业造成致命的损害,尽管很多企业加强了内部的管理制度,对重要数据严格管控,并不惜投入大 ...

  7. 浅析中国传统文化象征符号与VI的结合与发展

    摘 要 透过传统文化的历史延伸脉络,我们可以看出,传统文化本身是一个开放的系统,在新的技术与意识观念的冲击下而不断的更新 拓展,而其后的内涵与精神则是民族历史长期积淀的结果,是中华民族所特有的,也是民 ...

  8. 公司HP-EVA4400存储硬盘离线数据恢复方法

    一.故障描述 整个EVA存储结构是由一台EVA4400控制器,三台EVA4400扩展柜和28块FC 300G硬盘构成的.由于两块磁盘掉线导致存储某些LUN不可用,某些LUN丢失.由于EVA4400是因 ...

  9. 某医药公司HP-EVA4400数据恢复报告

    一.故障描述 1.设备清单 设备名称 设备型号 数量 HP-EVA4400控制器 AG638-53011 1 HP-EVA4400扩展柜 AG638-63001 3 HP-FC磁盘 300G FC硬盘 ...

最新文章

  1. 文巾解题1738. 找出第 K 大的异或坐标值
  2. RocketMQ原理解析-producer 4.发送分布式事物消息
  3. 使用python 的paramiko制作堡垒机
  4. JQuery绑定事件 时如何传递参数
  5. 自考计算机科学与技术本科毕业论文选题,自考计算机科学与技术专业(本)毕业论文写作指导...
  6. mysql-proxy代理加mysql主从实现读写分离
  7. 文献记录(part75)--基于最大平均熵率的大数据关联聚类算法
  8. java_math_BigDecimal
  9. 2015 上半年 JavaScript 使用统计数据
  10. 计算机应用基础讨论,计算机应用基础讨论
  11. 五线谱音名和组别对照表_五线谱最全知识及符号! 太实用了,100%收藏!!!...
  12. 汽车行业数字化工厂建设方案
  13. 计算机主机自动关机如何设置,电脑设置如何自动关机【图文教程】
  14. 常用的JavaScript位操作(Bitwise)
  15. 舍友老六,创业五年,现在在华为上班
  16. 音乐复兴:发烧友的耳朵有救了
  17. [JavaScript学习记录] 首次运用于网页,做一个简易利息计算器!!!
  18. C++二维vector使用教程
  19. Docker Swarm学习教程【转载】
  20. React前端开发入门与实战案例

热门文章

  1. 【caffe-Windows】关于LSTM的简单小例子
  2. 并行批处理多个文件 matlab
  3. github图---小章鱼图标
  4. 第二周进度及工作量统计
  5. BZOJ 3039: 玉蟾宫( 悬线法 )
  6. STM32堆栈溢出的问题
  7. 我想和你一起去这样一个地方
  8. Ajax — cropper (图片剪裁)基本用法
  9. 打造自己Django博客日记
  10. 全局eslint不生效的处理