- Ein während des Spielens eingefrorener PC geriet in eine BIOS-Schleife, und von zwei Seagate Firecuda 530 1TB SSDs wurde nur noch eine erkannt, wodurch eine Datenrettung dringend wurde
- Da das Laufwerk nur im kalten Zustand kurz funktionierte, wurde die SSD für 30 Minuten in einen -18 °C kalten Gefrierschrank gelegt; anschließend war das Laufwerk über ein NVMe-M.2-USB-Gehäuse auf einem Mac sichtbar
- Weil allein die Temperatur nicht genug Zeit verschaffte, wurde die Stelle gefunden, an der die SSD nur durch Druck auf einen bestimmten Chip funktionierte, und der Druck mit einer G-Zwinge und einem Kartenstück fixiert
- Als sich das Laufwerk während des Kopierens stark erhitzte, wurden ein PC-Kühlkörper und ein Teil eines Holzbearbeitungs-Winkelanschlags mit wärmeleitendem Klebeband befestigt, während die Temperatur mit einer Wärmebildkamera des CAT S60 überprüft wurde
- Nach erfolgreichem Kopieren von
/Usersund dem Erstellen einesdd-basierten 1-TB-Abbilds lief die SSD nach einer Behandlung mit einer SMD-Heißluftstation auch ohne Werkzeuge, sodass das Windows-Systemabbild auf eine neue Firecuda zurückgespielt und Backups aktiviert werden konnten
Entdeckung des Defekts und erste Diagnose
- Der Gaming-PC nutzte zwei Seagate Firecuda 530 1TB SSDs als Speicher
- Nach einigen Monaten Nutzung fror der PC während eines Spiels ein und geriet danach in eine BIOS-Schleife, sodass er nicht mehr bootete
- Von den beiden SSDs wurde nur noch eine erkannt; auch nach dem Tausch der Steckplätze zeigte dasselbe Laufwerk das Problem, wodurch sich der Fehler auf eine der SSDs eingrenzen ließ
- Nachdem der PC einige Tage unberührt geblieben war, bootete er beim nächsten Einschalten zwar in Windows, stürzte jedoch sofort wieder ab
Verfolgung eines Temperatur- und Kontaktproblems
- Da das Laufwerk im kalten Zustand kurz zu funktionieren schien, wurde ein temperaturbedingter Defekt immer wahrscheinlicher
- Nachdem die Firecuda für 30 Minuten in einen -18 °C kalten Gefrierschrank gelegt worden war, wurde sie in ein NVMe-M.2-USB-Gehäuse eingesetzt und war auf einem Mac sichtbar
- Die Funktionsdauer betrug nur wenige Minuten; sobald sich das Laufwerk erwärmte, fiel es wieder aus
- Weil ein fehlerhafter Kontakt irgendwo auf der Platine vermutet wurde, wurde wiederholt mit Ein- und Ausstecken experimentiert, bis die Stelle gefunden war, an der die SSD durch Druck auf einen bestimmten Chip funktionierte
Provisorische Haltevorrichtung aus Zwinge und Kartenstück
- Da sich Daten nicht kopieren ließen, während der Chip ständig von Hand gedrückt werden musste, kam eine G-Zwinge aus Metall zum Einsatz
- Um die SSD-PCB abzustützen, wurde ein Stück einer Silicon-Valley-Bank-Kreditkarte unter die SSD gelegt
- Wurde die G-Zwinge mit passender Stärke angezogen, sodass Druck auf den Chip ausgeübt wurde, funktionierte die SSD wieder
- Auf diese Weise ließ sich das Laufwerk auch ohne niedrige Temperatur wieder erkennen
Verstärkte Kühlung und Kopieren der Daten
- Die SSD wurde im Betrieb sehr heiß, weshalb für ein stabiles Kopieren zusätzliche Kühlung nötig war
- Ein zuvor im PC verwendeter Kühlkörper und ein Teil eines Holzbearbeitungs-Winkelanschlags wurden mit wärmeleitendem Klebeband befestigt und als provisorischer Kühlkörper genutzt
- Während des Kopiervorgangs wurde die Temperatur mit der Wärmebildkamera des CAT-S60-Smartphones kontrolliert
- Mit dieser Kombination wurde zuerst das Verzeichnis
/Userskopiert und gesichert - Anschließend wurde mit
dddas gesamte Laufwerk als einzelne 1-TB-Datei imaget
Behandlung mit Heißluft und abschließende Wiederherstellung
- Es wurde überlegt, die SSD mit einer SMD-Heißluftstation dauerhaft zu reparieren, allerdings erschien auch ein Austausch als sinnvoll
- Danach wurde der mit einem roten Pfeil markierte Chip mit einer SMD-Heißluftstation behandelt, und die SSD funktionierte anschließend auch ohne Holzbearbeitungswerkzeuge
- Nach der Reparatur konnte die SSD im PC wieder bis zum Booten verwendet werden
- Von dieser SSD wurde auf einem separaten Laufwerk ein Windows-Systemabbild erstellt und dieses Abbild auf eine neue Firecuda wiederhergestellt
- Zum Schluss wurden Backups aktiviert
1 Kommentare
Hacker-News-Kommentare
Vor langer Zeit, als ich in einem PC-Reparaturladen als Bench-Techniker arbeitete, habe ich etwas Ähnliches gemacht. Es war ein alter Connor-40-MB-Drive, auf dem DOS lief: Wenn man ihn genau richtig zusammendrückte, funktionierte er; drückte man zu fest oder zu schwach, erschien „Abort/retry/ignore“.
Also hielt ich den Drive mit der Hand gedrückt und drückte immer wieder
r, um es erneut zu versuchen, und am Ende klappte es. Als der Chef vorbeikam und fragte: „Was zum Teufel machst du da?“, antwortete ich: „Ich presse gerade die Daten aus diesem Drive!“Es gibt auch eine unterhaltsame Tour, die zeigt, wie erstaunlich simpel alte Laufwerkstechnik war: https://www.youtube.com/watch?v=8LbFKV_pPAE
Wenn auch das nicht half und die Daten wirklich gebraucht wurden, schickten wir sie zu Ontrack. Dort nahmen sie im Reinraum die Platter heraus und lasen die Daten direkt aus.
Das erinnert mich daran, wie ich als armer Student einmal einen Computer mit Essstäbchen repariert habe. Damals wusste ich nichts über kalte Lötstellen, aber ich fand heraus, dass ein instabiles Mainboard funktionierte, wenn man es in eine bestimmte Richtung bog.
Also klemmte ich ein Bambus-Essstäbchen zwischen Mainboard und Gehäuse, damit es leicht gebogen blieb, und so hielt es den Rest des Jahres durch.
Als später neue Sockeldesigns aufkamen, war ich wirklich erleichtert.
Es war zwar kein Holzwerkzeug, aber die merkwürdigste Reparatur, die ich je gemacht habe. Mein bis dahin gut funktionierendes Surface Pro 3 starb plötzlich und ließ sich nicht mehr einschalten; schließlich fand ich auf Reddit einen Beitrag von jemandem, der sein SP3 in einen verschlossenen Gefrierbeutel gepackt und ins Gefrierfach gelegt hatte, woraufhin es wieder zum Leben erwachte.
Ich war skeptisch und hielt es für wahrscheinlicher, dass Einfrieren es noch weiter beschädigen würde, aber das Gerät war ohnehin tot, also hatte ich nichts zu verlieren. Ich packte es in einen verschlossenen Gefrierbeutel, aus dem ich so viel Luft wie möglich herausgedrückt hatte, legte es ein paar Stunden ins Gefrierfach, nahm es heraus, schloss es an den Strom an – und es startete.
Zunächst hielt es nur ein paar Tage durch, aber nach erneutem Einfrieren lebte es wieder auf, und selbst jetzt, Jahre später, funktioniert es noch. Es sah nach einem Stromversorgungsproblem aus, und ich vermute, dass durch das Einfrieren des Akkus chemisch irgendein Zyklus angestoßen wurde, der ihn wiederhergestellt hat.
Allerdings wickelte ich das Surface in mehrere Lagen Handtücher, damit die Temperatur langsam anstieg. Vor allem, um zu verhindern, dass sich irgendwo im Inneren Feuchtigkeit bildet.
https://www.reddit.com/r/Surface/comments/5tficj/how_i_reviv...
Es hieß, die SSD werde im Betrieb ziemlich heiß und sei mit einem PC-Kühlkörper, einem Teil eines Schreinerwinkels und wärmeleitendem Klebeband gekühlt worden; ich würde stattdessen einen Lüfter empfehlen. Selbst ein kleiner Lüfter erzeugt, neben dem Gerät platziert, weit mehr Luftstrom als nötig.
Man könnte zwar mit Bohrmaschine, Industriesauger oder Kreissäge Luftstrom erzeugen, aber das wäre deutlich weniger energieeffizient als ein passiver Kühlkörper.
Mit Reflow des Controllers hatte ich bislang zweimal Erfolg. Der eine Fall war ein Intel-Optane-Drive, das drei Jahre problemlos lief und eines Tages zu überhitzen begann; der andere war ein mSATA-Drive in einer lüfterlosen Maschine, der an einem Sonntag starb, als ich auch keine Ersatz-mSATA-Disk hatte.
In beiden Fällen suchte ich unter dem Mikroskop nach kurzgeschlossenen Kondensatoren, fand aber keine; am Ende waren ermüdete BGA-Lötkugeln unter dem Controller das Problem. Mit einem Reflow von 225 °C Soak → 400 °C Peak → 325 °C Hold ließ es sich wiederbeleben.
https://microchip.my.site.com/s/article/SAM-Cortex-M3-M4-M7-...
Ein großartiges Beispiel. Wirkt wie die moderne Version des Ingenieurs-Schlags, den man früher bei alten rotierenden Laufwerken angewandt hat, wenn sie nicht mehr hochdrehten.
Offenbar verhärtete sich das interne Schmiermittel, wenn die Maschine eine Weile ausgeschaltet war. Also ließ ich die Abdeckung des Laufwerksschachts ab und berührte das Laufwerk mit dem Finger; so startete es jahrelang zuverlässig.
Mit Unterlegscheiben an der Kühlkörper-Klemme entstand derselbe Druck, also machte ich es so, und seit Monaten läuft sie problemlos. Die Lötstellen der GPU werden durch thermischen Stress anfällig, und durch Druck wird der Kontakt wiederhergestellt.
Druck auszuüben oder ein Reflow ist nur ein Provisorium; die eigentliche Reparatur wäre ein Reballing der GPU, aber das wird teuer.
Dass eine Firecuda, nachdem sie 30 Minuten in einem Gefrierschrank bei -18 °C lag und dann in ein NVMe-M.2-USB-Gehäuse gesteckt wurde, auf dem Mac sichtbar war, bedeutet wohl, dass der Kühlschrank-Trick jetzt auch bei NVMe funktioniert.
Schon vor etwa 20 Jahren habe ich einmal eine alte HDD für rund 30 Minuten in den Kühlschrank gelegt, die Dateien heruntergezogen und das Laufwerk danach entsorgt.
Ich holte Eis aus der Eismaschine des Hotels und hielt den Laptop mit einem Lüfter und einem Metalltablett am Leben, bis die Arbeit erledigt war.
Ich frage mich, ob 42 °C für eine NVMe wirklich heiß sind. Ich habe kürzlich angefangen, SMART-Statistiken von mehreren Laufwerken bei mir zu Hause zu sammeln, und bei meinen Laufwerken scheint ungefähr diese Temperatur selbst in nahezu idle-nahem Zustand normal zu sein.
Ich habe auch schon gehört, dass es der Performance schaden kann, NVMe-Laufwerke zu kalt zu halten. Wichtiger ist aber: Man muss unbedingt Backups machen. Freunde in meinem Umfeld mögen Synology, aber ich bin sparsam und nutze urbackup; das hat mir schon ein paarmal größeren Ärger erspart.
https://www.worldbackupday.com/
Die Diagnosefähigkeit und Kreativität bei der Datenrettung sind beeindruckend, aber in derselben Situation hätte ich wohl einfach aus dem Backup wiederhergestellt. Ich habe etwas ungewöhnlich ein Home-Lab mit einem Dateiserver auf echter Server-Hardware, auf den Desktops und Laptops gesichert werden, und dieser lokale Server wird wiederum auf einen Remote-Server gesichert.
Beispiel: Samsung https://download.semiconductor.samsung.com/resources/data-sh...
Abgesehen davon, das Gerät an einen professionellen Datenrettungsdienst zu schicken, frage ich mich, ob es eine Möglichkeit gibt, auf die Daten einer HDD mit defekter Controller-Karte zuzugreifen. Auch eine Ersatz-Controller-Karte aus einer neu gekauften HDD desselben Modells wird nicht akzeptiert.
Mit spezieller Hardware und Software lassen sich diese Daten auslesen und in den Speicher einer anderen Platine schreiben; die günstigere Methode ist jedoch, den eigentlichen Chip von der alten Platine auf eine neue, identische Platine umzusetzen.
Das wird oft ROM Swap genannt. Meist handelt es sich um einen einfachen 8-Pin-Chip, sodass man es selbst machen kann, wenn man mit Löten und Entlöten vertraut ist. Wenn nicht, erledigen das in der Regel Hardware-Reparaturwerkstätten wie etwa Handy-Reparaturläden.
Bei relativ aktuellen HDDs kann es allerdings sein, dass es keinen separaten Chip gibt; daher muss man das Modell prüfen. Weitere Informationen gibt es hier: https://hddpcb.eu/gb/content/how-to-swap-hdd-pcb
Viele „defekte“ Laufwerke lassen sich auf diese Weise zumindest noch für ein paar Stunden zum Laufen bringen. Wenn es wie im Originalbeitrag noch Lebenszeichen gibt, sollte man nicht mit Klemmen oder Reflow herumprobieren, sondern die Daten besser mit langen Strom-/SATA-Kabeln auslesen, während das Laufwerk mit einem Computer außerhalb der Gefrierschrank- oder Ofentür verbunden ist.
Für die Datenextraktion empfiehlt sich GNU ddrescue. Wenn vor dem endgültigen Ausfall nur noch ein paar Stunden bleiben, maximiert es die Menge der in der verfügbaren Zeit geretteten Daten. Wenn man vermutet, dass das Laufwerk größtenteils leer ist, gibt es auch verschiedene brauchbare Methoden, eine Map-Datei zu erstellen, um die Wiederherstellung leerer Blöcke zu überspringen.
https://www.hddzone.com/hard_drive_pcb_replacement.html
Wenn es wirklich die richtige Platine ist und trotzdem gar nichts reagiert, ist es möglicherweise der Punkt, an dem man professionelle Hilfe braucht oder die Daten als verloren betrachten muss.
Eine verdächtige Flash-Speicherlösung provisorisch mit einer Holzbearbeitungsklemme und einem Stück einer Silicon-Valley-Bank-Kreditkarte repariert – das ist die HN-typischste Geschichte, die ich je gesehen habe.