- Der Transformer, der 2017 aufkam, begann mit maschineller Übersetzung, breitete sich dann auf nahezu alle Bereiche aus und ist zu einem zentralen KI-Thema geworden, das moderne Ingenieure verstehen sollten
- Dieser Leitfaden ist schrittweise aufgebaut — von neuronalen Netzen bis zu Attention — damit Ingenieure genau so weit folgen können, wie es zum Verständnis des Transformers nötig ist
- Mit ausführbaren Python-Codebeispielen und Referenzmaterial endet das Lernen nicht beim Lesen, sondern kann praktisch nachvollzogen und überprüft werden
- Der Hauptteil ist in neuronale Netze, RNN, NLP und Attention, Transformer sowie einen Anhang zu Python- und Mathematikgrundlagen gegliedert; zusätzlich wurden Abschnitte zu PyTorch und LLM-basierten Multi-Agents ergänzt
- Die Nutzungsbedingungen für Bildung und nichtkommerzielle Zwecke sind vergleichsweise offen; bei Anfragen werden jedoch zur Verifizierung mindestens zwei SNS-Profile verlangt, wodurch anonyme Kontaktaufnahme eingeschränkt ist
Lernpfad zum Verständnis von Transformern
- The Engineer’s Guide To Deep Learning ist ein kompaktes Handbuch, das Ingenieuren den minimal nötigen Pfad zum Verständnis von Transformern bietet
- Die aktuelle Phase der KI wird als das dritte goldene Zeitalter beschrieben
- Die beiden vorherigen goldenen Zeitalter lagen in den 1950er/1960er Jahren und in den 1980er Jahren
- Damals übertrafen die Erwartungen die technischen Möglichkeiten, was zu Enttäuschung führte
- Das aktuelle KI-Goldene-Zeitalter, das Mitte der 2010er begann, wird als eine Phase beschrieben, in der die Erwartungen fortlaufend übertroffen werden
- Der Transformer war der Durchbruch von 2017
- Ursprünglich wurde er als Modell für maschinelle Übersetzung entwickelt
- Danach weitete sich sein Einfluss auf nahezu alle Bereiche aus
- Als Lernhilfe werden ausführbare Python-Codebeispiele bereitgestellt
- Zusätzlich werden weitere Referenzmaterialien vorgestellt, damit Leser je nach Bedarf passende Quellen auswählen können
Aufbau des Dokuments und Updates
- Der Leitfaden springt nicht direkt zum Transformer, sondern baut die nötigen Grundlagen in sinnvoller Reihenfolge auf
- Part 1: Neural Networks — Grundkonzepte neuronaler Netze
- Part 2: Recurrent Neural Networks (RNNs) — RNN, LSTM, GRU
- Part 3: Natural Language Processing (NLP) and Attention Mechanisms — zentrale NLP-Prinzipien einschließlich maschineller Übersetzung und Attention
- Part 4: Transformer — das Transformer-Modell
- Appendix: Basic Knowledge — minimales Python- und Mathematikwissen zum Verständnis von Transformern
- Die Änderungshistorie wird seit der ersten Veröffentlichung am 21. Mai 2024 fortgeführt
-
- Juli 2024: PyTorch-Versionen für Part 1 und 2 hinzugefügt
-
- September 2024: Abschnitt zu LLM-basierten Multi-Agents hinzugefügt
-
- Künftig könnten auch mehrere derzeit in Entwicklung befindliche Transformer-basierte Technologien sowie der nächste große Durchbruch in naher Zukunft behandelt werden
Nutzungsbedingungen und Kontaktweg
- Die Nutzungsbedingungen in den Copyright-FAQ sind vor allem für Bildung und nichtkommerzielle Nutzung offen gehalten
- Lehrkräfte und Studierende an Bildungseinrichtungen dürfen Dokumente und Abbildungen frei für Lernzwecke verwenden
- Bei nichtkommerziellen Treffen und Vorträgen dürfen Dokumente und Abbildungen verwendet werden, wenn ein Link zur Website und der Copyright-Hinweis angegeben werden
- Die Erläuterungen zu revenue share und full buyout im Abschnitt zur kommerziellen Nutzung seien scherzhaft gemeint; es bestehe keine Absicht, kommerzielle Beziehungen einzugehen
- In Anfragen per E-Mail müssen zur Verifizierung mindestens zwei SNS-Adressen wie LinkedIn oder Twitter angegeben werden
- Seit dem XZ-Backdoor-Vorfall werden keine Kontaktaufnahmen von anonymen Einzelpersonen angenommen
1 Kommentare
Meinungen auf Hacker News
Transformers from Scratch: https://e2eml.school/transformers.html
Auch Andrej Karpathys Einsteigerreihe ist gut: https://karpathy.ai/zero-to-hero.html
Let's build GPT: from scratch, in code, spelled out: https://www.youtube.com/watch?v=kCc8FmEb1nY
GPT with Andrej Karpathy: Part 1: https://medium.com/@kdwa2404/gpt-with-andrej-karpathy-part-1...
3Blue1Browns „But what is a GPT? Visual intro to transformers | Chapter 5, Deep Learning“: https://www.youtube.com/watch?v=wjZofJX0v4M
„Attention in transformers, visually explained | Chapter 6, Deep Learning“: https://www.youtube.com/watch?v=eMlx5fFNoYc
Gesamte Neural-Network-Playlist von 3Blue1Brown: https://www.youtube.com/playlist?list=PLZHQObOWTQDNU6R1_6700...
Für ein Keras-Tutorial ist das ziemlich teuer.
Mein Plan ist, die Gewinnerlösungen des letzten Jahres zu verstehen und mir dann eine kleinere Teilaufgabe auszusuchen: https://scrollprize.org/
Der Abschnitt, in dem etwa die Gradienten eines LSTM hergeleitet werden, soll nicht dabei helfen, es im bevorzugten Framework zu implementieren, sondern dem Verständnis dienen.
Auch der Zweck, Lösungen in mehreren Frameworks zu zeigen, besteht darin, die Verbindung herzustellen, wie die Gleichungen aussehen und wie sie im Code aussehen könnten.
Besonders interessant an der Transformer-Architektur ist, dass der Attention-Mechanismus permutationsinvariant ist. Umso mehr, wenn man keine Positions-Embeddings verwendet, um diese besondere Eigenschaft wieder auszugleichen; außerdem lassen sich bestimmte Knoten in einem Graphen oder einzelne Kanten beliebig maskieren, was viel Flexibilität bietet, Domänenwissen in die Architektur einfließen zu lassen.
In vielen Fällen braucht man Positions-Embeddings vielleicht trotzdem, aber man kann intelligenter entwerfen, wenn man sich von der zu stark eingeschränkten Sicht löst, die Eingaben einer Attention-Schicht nur als einfache eindimensionale Sequenz zu betrachten.
Soweit ich es verstehe, ist ein ML Engineer jemand, der mit Frameworks wie PyTorch Modelle baut, ein AI Engineer jemand, der per Prompt Engineering oder auf AI-Lösungen wie der OpenAI-/Claude-API Anwendungen baut, und MLOps sind Leute, die bei Deployment und Serving von Modellen helfen. Ich frage mich, ob diese Einteilung stimmt.
In der Praxis können die genannten Rollen alles umfassen, von „macht Spitzenforschung“ bis „hat schon einmal eine CSV geöffnet“.
Wenn du Wirkung erzielen willst, werde darin sehr gut. Das sind Fähigkeiten, die auch in Bereichen wie Systemintegration oder Business Analysis nützlich sind; Algorithmen und heutzutage sogar trainierte Modelle können dir die Forschenden liefern.
Es ist ziemlich bitter zu sehen, dass selbst unter Technikern soziale Netzwerke als Mittel zur Identitäts- und Vertrauensprüfung übernommen werden. Es war schon schlimm genug, als einige Regierungen anfingen, für Visa-/Einwanderungsprüfungen Social-Network-Benutzernamen zu verlangen; jetzt braucht man sogar sozialen Nachweis, um einem Techniker eine E-Mail zu schicken?
Der XZ-Angreifer hätte sich vermutlich bei zahlreichen Diensten über GitHub anmelden können. Der Autor des Originaltexts hält es auch für wahrscheinlich, dass er etwas von PyPI herunterlädt, das durch ein über ein Jahr lang herumliegendes Token-Leak potenziell kompromittiert war.
Außerdem ist er im Machine-Learning-Bereich, lädt also wahrscheinlich riesige Python-Frameworks von GitHub, conda und PyPI herunter, die schwer zu auditieren sind, und Leute in diesem Feld laden auch nicht vertrauenswürdige Modelle herunter und experimentieren damit.
Und das Problem soll eine Plaintext-E-Mail sein, die man in einem Kommandozeilen-Mailclient mit deaktiviertem MIME und sonstigen Erweiterungen lesen kann?