Ik heb hier een raar geval, afgelopen nacht was een machine plotseling vastgelopen. Na een reboot middels de APC, is de machine begonnen met het rebuilden van de lokale RAID-1 array.
Na wat zoeken in de logfiles bleek dat er een probleem op /dev/sda is ontstaan (enkele minuten voor de crash):
Tijdens het rebuilden van de array begint het hele zaakje te loopen. Rebuilden gaat prima, tot +/- 80%, daarna begint het verhaal weer helemaal bij 0%.Code:Mar 13 00:29:07 server kernel: ata1.00: exception Emask 0x0 SAct 0x7 SErr 0x0 action 0x0 Mar 13 00:29:07 server kernel: ata1.00: irq_stat 0x40000008 Mar 13 00:29:07 server kernel: ata1.00: cmd 60/00:00:33:86:00/01:00:6e:00:00/40 tag 0 ncq 131072 in Mar 13 00:29:07 server kernel: res 41/40:00:4d:86:00/c8:00:6e:00:00/40 Emask 0x409 (media error) <F> Mar 13 00:29:07 server kernel: ata1.00: status: { DRDY ERR } Mar 13 00:29:07 server kernel: ata1.00: error: { UNC } Mar 13 00:29:07 server kernel: ata1.00: configured for UDMA/133 Mar 13 00:29:07 server kernel: ata1: EH complete Mar 13 00:29:11 server kernel: ata1.00: exception Emask 0x0 SAct 0x4 SErr 0x0 action 0x0 Mar 13 00:29:11 server kernel: ata1.00: irq_stat 0x40000008 Mar 13 00:29:11 server kernel: ata1.00: cmd 60/00:10:33:86:00/01:00:6e:00:00/40 tag 2 ncq 131072 in Mar 13 00:29:11 server kernel: res 41/40:00:53:86:00/00:00:6e:00:00/40 Emask 0x409 (media error) <F> Mar 13 00:29:11 server kernel: ata1.00: status: { DRDY ERR } Mar 13 00:29:19 server kernel: ata1.00: error: { UNC } Mar 13 00:29:22 server kernel: ata1.00: configured for UDMA/133 Mar 13 00:29:27 server kernel: ata1: EH complete Mar 13 00:29:30 server kernel: ata1.00: exception Emask 0x0 SAct 0x1 SErr 0x0 action 0x0 Mar 13 00:29:35 server kernel: ata1.00: irq_stat 0x40000008 Mar 13 00:29:39 server kernel: ata1.00: cmd 60/00:00:33:86:00/01:00:6e:00:00/40 tag 0 ncq 131072 in Mar 13 00:29:43 server kernel: res 41/40:00:4d:86:00/00:00:6e:00:00/40 Emask 0x409 (media error) <F> Mar 13 00:29:43 server kernel: ata1.00: status: { DRDY ERR } Mar 13 00:29:48 server kernel: ata1.00: error: { UNC } Mar 13 00:29:51 server kernel: ata1.00: configured for UDMA/133 Mar 13 00:29:59 server kernel: ata1: EH complete Mar 13 00:30:04 server kernel: ata1.00: exception Emask 0x0 SAct 0x1 SErr 0x0 action 0x0 Mar 13 00:30:14 server kernel: ata1.00: irq_stat 0x40000008 Mar 13 00:30:15 server kernel: ata1.00: cmd 60/00:00:33:86:00/01:00:6e:00:00/40 tag 0 ncq 131072 in Mar 13 00:30:19 server kernel: res 41/40:00:4d:86:00/00:00:6e:00:00/40 Emask 0x409 (media error) <F> Mar 13 00:30:23 server kernel: ata1.00: status: { DRDY ERR } Mar 13 00:30:25 server kernel: ata1.00: error: { UNC } Mar 13 00:30:31 server kernel: ata1.00: configured for UDMA/133 Mar 13 00:30:31 server kernel: ata1: EH complete Mar 13 00:30:38 server kernel: ata1.00: exception Emask 0x0 SAct 0x1 SErr 0x0 action 0x0 Mar 13 00:30:39 server kernel: ata1.00: irq_stat 0x40000008 Mar 13 00:30:43 server kernel: ata1.00: cmd 60/00:00:33:86:00/01:00:6e:00:00/40 tag 0 ncq 131072 in Mar 13 00:30:47 server kernel: res 41/40:00:4d:86:00/00:00:6e:00:00/40 Emask 0x409 (media error) <F> Mar 13 00:30:47 server kernel: ata1.00: status: { DRDY ERR } Mar 13 00:30:49 server kernel: ata1.00: error: { UNC } Mar 13 00:30:54 server kernel: ata1.00: configured for UDMA/133 Mar 13 00:30:55 server kernel: ata1: EH complete Mar 13 00:30:55 server kernel: ata1.00: exception Emask 0x0 SAct 0x1 SErr 0x0 action 0x0 Mar 13 00:30:55 server kernel: ata1.00: irq_stat 0x40000008 Mar 13 00:30:55 server kernel: ata1.00: cmd 60/00:00:33:86:00/01:00:6e:00:00/40 tag 0 ncq 131072 in Mar 13 00:30:56 server kernel: res 41/40:00:53:86:00/00:00:6e:00:00/40 Emask 0x409 (media error) <F> Mar 13 00:30:56 server kernel: ata1.00: status: { DRDY ERR } Mar 13 00:30:56 server kernel: ata1.00: error: { UNC } Mar 13 00:30:56 server kernel: ata1.00: configured for UDMA/133 Mar 13 00:30:56 server kernel: sd 0:0:0:0: SCSI error: return code = 0x08000002 Mar 13 00:30:56 server kernel: sda: Current [descriptor]: sense key: Medium Error Mar 13 00:30:56 server kernel: Add. Sense: Unrecovered read error - auto reallocate failed Mar 13 00:30:56 server kernel: Mar 13 00:30:56 server kernel: Descriptor sense data with sense descriptors (in hex): Mar 13 00:30:56 server kernel: 72 03 11 04 00 00 00 0c 00 0a 80 00 00 00 00 00 Mar 13 00:30:56 server kernel: 6e 00 86 53 Mar 13 00:30:56 server kernel: end_request: I/O error, dev sda, sector 1845528147
De betreffende errors gaan allemaal over "read" errors. Smart info ziet er redelijk schoon uit, geen "reallocated sectors", maar wel een stuk of 40 "Current_Pending_Sector".Code:md3 : active raid1 sdb4[2] sda4[0] 954622336 blocks [2/1] [U_] [====>................] recovery = 21.6% (206643776/954622336) finish=367.3min speed=33936K/sec
Al met al lijken er nog geen bad sectors remapped te zijn.
Normaal gesproken is het natuurlijk "simpel" om even de (mogelijk) rotte schijf (sda) te verwisselen, maar dat gaat in dit geval niet omdat de machine weigert zijn RAID-1 array te rebuilden. Zolang de array niet in orde is, heb ik niet de mogelijkheid om /dev/sda als failed te markeren aangezien /dev/sda op dit moment de enige "active" disk is.
Code:# mdadm -D /dev/md3 /dev/md3: Version : 0.90 Creation Time : Sun Oct 3 16:43:47 2010 Raid Level : raid1 Array Size : 954622336 (910.40 GiB 977.53 GB) Used Dev Size : 954622336 (910.40 GiB 977.53 GB) Raid Devices : 2 Total Devices : 2 Preferred Minor : 3 Persistence : Superblock is persistent Update Time : Tue Mar 13 17:13:19 2012 State : active, degraded, recovering Active Devices : 1 Working Devices : 2 Failed Devices : 0 Spare Devices : 1 Rebuild Status : 23% complete UUID : ea682742:2847b158:129d617b:7c93e4c5 Events : 0.31711407 Number Major Minor RaidDevice State 0 8 4 0 active sync /dev/sda4 2 8 20 1 spare rebuilding /dev/sdb4
Iemand hier iets vergelijkbaars meegemaakt? Zou er een oplossing zijn de betreffende sectors te skippen, en op deze manier de hele array te kunnen syncen.

Likes:


Quote
Dit is niet sarcastisch bedoeld.
