- Eine Sammlung von praxisnahen Guides und Beispielen zur Umsetzung von Claude-Anwendungen, die ein breites Spektrum von Agentenbau über RAG, Tool-Nutzung, Multimodalität bis hin zu Evaluierung abdeckt
- Beispiele zu Claude Agent SDK und Managed Agents enthalten Betriebs-Patterns wie Multi-Agenten-Orchestrierung, Session-Management, Deployment, Störungsbehebung, Schwachstellenerkennung und User Memory
- Bietet Memory- und Kontextkomprimierung für lang laufende Agenten, programmatische Tool-Aufrufe, embedding-basierte Tool-Suche und asynchrone Sub-Agenten-Techniken
- Neben RAG, SQL-Generierung, Wissensgraphen, Dokumentzusammenfassung sowie Bild- und Audioverarbeitung lassen sich auch Evaluierung, Kosten, Observability und Guardrails anhand von Implementierungsbeispielen nachvollziehen
- Umfasst Deployment mit Docker, Modal und Kubernetes, Prompt-Versionsverwaltung und Rollback, menschliche Freigaben sowie Kostenanalyse und ist damit für Entwicklung und Produktivbetrieb insgesamt nutzbar
Agenten-Evaluierung und Guardrails
- Reproduktion von Claudes Benchmark-Ergebnissen für agentische Suche: Reproduziert mit einem Messages-API-Harness die Werte von DeepSearchQA und BrowseComp und nutzt dabei programmatische Tool-Aufrufe, serverseitige Komprimierung und Arbeitsbudgets
- Classifier-Fallback und Abrechnung in Claude Fable 5: Erkennt Blockierungen durch den Sicherheits-Classifier, schaltet auf Opus 4.8 um und behandelt serverseitige oder SDK-seitige Fallbacks, Streaming sowie neue Abrechnungsänderungen
- Tool-Evaluierung: Führt parallele Agenten-Evaluierungen für Tools unabhängig von den Dateien der Evaluierungsaufgabe aus
- Aufbau von Evaluierungen: Baut ein Evaluierungssystem auf, das Claudes Leistung anhand zentraler Metriken misst und verbessert
- Generierung synthetischer Testdaten für Prompt-Templates: Erzeugt synthetische Testfälle, um Claude-Prompts zu evaluieren und zu verbessern
- Aufbau eines Moderationsfilters mit Claude: Definiert Regeln und Kategorien im Prompt und erstellt so einen angepassten Content-Moderationsfilter
Multi-Agenten- und Workflow-Patterns
- Asynchrone Multi-Agenten-Orchestrierung: Behandelt Messaging- und Lebenszyklusstrukturen eines festen Teams aus N Agenten, das Peer-Nachrichten über einen gemeinsamen Hub austauscht, sowie dynamisch erzeugter asynchroner Sub-Agenten
- Multi-Agenten: Orchestrierung eines Spezialistenteams: Ein Orchestrator führt Web-Search-Researcher, Datei-Prüfer und regelbasierte Preisverantwortliche, um ein Sales-Angebot zu erstellen
- Enthält das Feld
multiagent, die Eventsthread_createdundthread_message_receivedsowie rollenbasierte Einschränkungen des Tool-Scopes
- Enthält das Feld
- Outcomes: Agenten, die ihre eigene Arbeit verifizieren: Baut eine Bewertungs- und Verbesserungs-Loop auf, bei der ein Autor eine zitierte Research-Zusammenfassung erstellt, ein zustandsloser Grader URLs und Zitate prüft und bis zum Bestehen Korrekturen anstößt
- Behandelt
user.define_outcome,span.outcome_evaluation_*-Events und wie Bewertungsmaßstäbe geschrieben werden, die der Grader ausführen kann
- Behandelt
- Grundlegende Workflows: Bietet drei Multi-LLM-Patterns, die Kosten oder Latenz gegen Leistung abwägen
- Evaluator-Optimierer: Eine iterative Struktur, in der ein LLM Ergebnisse erzeugt und ein anderes LLM evaluatives Feedback liefert
- Orchestrator-Worker: Ein zentrales LLM delegiert Aufgaben dynamisch und fasst die Ergebnisse von Worker-LLMs zusammen
- Haiku als Sub-Agent verwenden: Ein Haiku-Sub-Agent extrahiert Finanzberichte und Opus fasst die Ergebnisse zusammen
Claude Agent SDK
- Einzeiliger Research-Agent: Baut mit Claude Code SDK und
WebSearcheinen autonomen Research-Agenten - Chief-of-Staff-Agent: Erstellt mit Sub-Agenten, Hooks, Output-Stilen und Planungsmodus ein Multi-Agenten-System
- Observability-Agent: Verbindet den Agenten über einen MCP-Server mit externen Systemen und verarbeitet GitHub-Monitoring sowie CI-Workflows
- Site-Reliability-Agent: Diagnostiziert und behebt Störungen mit Lese-/Schreib-MCP-Tools und erstellt Postmortem-Berichte
- Migration vom OpenAI Agents SDK: Ordnet am Beispiel eines Agenten für Kostenfreigaben Tools, Guardrails, Sessions und Handoffs den Grundbausteinen des Claude Agent SDK zu
- Aufbau eines Session-Browsers: Listet Agent-SDK-Sessions auf der Festplatte auf, zeigt sie an, benennt sie um, taggt und forkt sie und erstellt so eine Sidebar ohne separaten Parser für Gesprächsverläufe
- Schwachstellenerkennungs-Agent: Führt Threat Modeling für C-Ziele durch, findet mit integrierten Dateitools Memory-Safety-Bugs und klassifiziert sie in einem strukturierten Bericht
- Hosting des Agenten: Rollt denselben Container-Image- und HTTP-Interface-Stack für den Research-Agenten in drei Stufen auf Docker, Modal und Kubernetes aus
Claude Managed Agents
- Einen Agenten bauen, der sich an Nutzer erinnert: Nutzt einen Memory-Speicher, um Nutzerpräferenzen über mehrere Interaktionen hinweg zu lernen und zu behalten
- Mit Claude Managed Agents einen SRE-Agenten für Incident Response bauen: Liest bei einem Alarm Logs und Runbooks, findet die Root Cause, eröffnet einen Fix-PR und merged nach menschlicher Freigabe
- Einen Datenanalyse-Agenten bauen: Nutzt eine Sandbox-Umgebung und File-Mounts, um CSVs in HTML-Berichte mit interaktiven Diagrammen umzuwandeln
- Einen Slack-Datenanalyse-Bot bauen: Wenn der Bot zusammen mit einer CSV erwähnt wird, erstellt er im Thread einen Analysebericht und unterstützt Folgegespräche in derselben Session
- Managed-Agents-Tutorial: Eine Suite fehlschlagender Tests verbessern: Behebt mithilfe von Agent-, Umgebungs- und Session-Erstellung, File-Mounts und einer Streaming-Event-Loop drei Bugs im
calc.py-Paket - Managed-Agents-Tutorial: Produktionseinrichtung: Behandelt Vault-basierte MCP-Credentials, den
session.status_idled-Webhook für Human-in-the-Loop ohne dauerhafte Verbindung sowie Resource-Lifecycle-CRUD - Managed-Agents-Tutorial: Prompt-Versionierung und Rollback: Erstellt serverseitig v1, evaluiert sie mit einem gelabelten Testset, erkennt Regressionen in v2 und pinnt die Session auf Version 1
- Umfasst Versions-Pinning für
agents.updateundsessions.createsowie die Stelle, an die sich der Review-Gate verlagert, wenn Prompts kein Code sind
- Umfasst Versions-Pinning für
Speicher- und Kontextverwaltung
- Context Engineering: Speicher, Komprimierung und Tool-Entfernung: Vergleicht bei lang laufenden Agenten je Strategie den Einsatzzeitpunkt, die Kosten und die Kombinationsweise
- Session-Speicherkomprimierung: Komprimiert den Session-Speicher langer Unterhaltungen sofort mit Background-Threading und Prompt-Caching
- Automatische Kontextkomprimierung: Komprimiert in lang laufenden Agent-Workflows den Gesprächsverlauf automatisch, um Kontextlimits zu verwalten
- Speicher- und Kontextverwaltung in Claude Sonnet 4.6: Baut mit Claudes Memory-Tool und Context Editing einen Agenten mit persistentem Speicher
- Spekulatives Prompt-Caching: Bereitet den Cache vor, während Nutzer ihre Anfrage schreiben, um die Time-to-First-Token zu verkürzen
- Prompt-Caching in der Claude API: Cached und nutzt Prompt-Kontext wieder, um Kosten und Antwortzeiten zu senken
Tool-Nutzung und externe Integration
- Programmgesteuerte Tool-Aufrufe: Lässt Claude den Code für Tool-Aufrufe in einer Code-Ausführungsumgebung schreiben, um Latenz und Token-Verbrauch zu senken
- Tool-Suche mit Embeddings: Erweitert Claude-Anwendungen mit dynamischer Suche auf Basis semantischer Embeddings auf Tausende von Tools
- Parallele Tool-Aufrufe in Claude 3.7 Sonnet: Aktiviert parallele Aufrufe, indem das Batch-Tool-Metapattern als Workaround genutzt wird
- Tool-Auswahl: Erzwingt oder automatisiert Claudes Tool-Auswahl mit dem Parameter
tool_choice - Ein Memory-Speicher-Tool durch Kombination von Pydantic und Anthropic Tool Use: Erstellt typsichere Tools, die mit Pydantic-Modellen validiert werden
- Einsatz eines Rechner-Tools in Claude: Stellt ein Rechner-Tool für arithmetische Operationen und das Lösen mathematischer Probleme bereit
- Mit clientseitigen Tools einen Kundenservice-Agenten erstellen: Baut einen Chatbot, der Tools für Kundenabfragen und Bestellverwaltung nutzt
- Strukturierte JSON-Extraktion mit Claude und Tool Use: Extrahiert strukturierte JSON-Daten aus mehreren Eingaben
- Wolfram Alpha LLM API in Claude als Tool verwenden: Integriert die Wolfram Alpha LLM API für Berechnungsanfragen und Antworten
- Agent zur Anreicherung von Threat Intelligence: Untersucht und kreuzvalidiert Indicators of Compromise aus mehreren Threat-Intelligence-Quellen, mappt sie auf MITRE ATT&CK und erstellt Berichte für SIEM und SOAR
Suche, RAG und Wissensverarbeitung
- Aufbau eines Wissensgraphen mit Claude: Extrahiert Entitäten und Beziehungen aus unstrukturiertem Text, entfernt Duplikate und unterstützt Multi-Hop-Graph-Abfragen
- Text-to-SQL mit Claude: Wandelt natürliche Sprache mit RAG, Gedankengang und Selbstverbesserungstechniken in SQL um
- RAG mit kontextueller Suche verbessern: Fügt Chunks vor dem Embedding Kontext hinzu und nutzt Prompt Caching, um die RAG-Genauigkeit zu erhöhen
- Retrieval-Augmented Generation: Erstellt und optimiert RAG-Systeme mit Zusammenfassungs-Indexierung und Re-Ranking
- Klassifizierung mit Claude: Baut ein Klassifizierungssystem für Versicherungstickets auf, das RAG und Gedankengang nutzt
- Zitate: Liefert überprüfbare, detaillierte Quellenzitate für dokumentbasierte Anfragen
- Webseiteninhalte mit Claude 3 Haiku zusammenfassen: Ruft Inhalte von URLs ab und fasst sie mit Claude 3 Haiku zusammen
- SQL-Abfragen mit Claude erstellen: Erzeugt SQL aus natürlichsprachlichen Fragen, indem Datenbankschema-Kontext bereitgestellt wird
- Retrieval-Augmented Generation mit Pinecone: Verbindet Claude mit der Pinecone-Vektordatenbank, um RAG und semantische Suche umzusetzen
- Aufbau eines RAG-Systems mit Claude 3 und MongoDB: Baut einen Claude-MongoDB-Chatbot auf, der Techniknachrichten als Wissensbasis nutzt
- Claude 3 RAG-Agent und LangChain v1: Erstellt einen RAG-Agenten mit dem aktualisierten Agent-Framework-Muster von LangChain v1
- Multi-Dokument-Agenten: Baut RAG für große Dokumentensammlungen mit DocumentAgents und dem ReAct-Muster auf
- RAG-Pipeline mit LlamaIndex: Erstellt eine grundlegende Pipeline für Dokumentensuche und Frage-Antwort
- RouterQuery-Engine: Leitet Abfragen mit LlamaIndex
RouterQueryEnginean verschiedene Indizes weiter - SubQuestionQueryEngine: Zerlegt komplexe Abfragen in Unterfragen über mehrere Dokumente hinweg
- PDFs per API in Claude „hochladen“: Verarbeitet und fasst PDF-Dokumente per Textextraktion und Kodierung zusammen
- Iterative Wikipedia-Suche mit Claude: Ein Legacy-Notebook für einen Forschungs-Workflow, der Wikipedia mit Claude 2 iterativ durchsucht
Multimodalität, Sprache und Dokumente
- Bereitstellung eines Zuschneide-Tools zur Verbesserung der Bildanalyse: Vergrößert bestimmte Bereiche von Diagrammen, Dokumenten und Schaubildern für eine detaillierte Analyse
- Vision und Tools in Claude gemeinsam verwenden: Kombiniert Bildverständnis und Tools, um strukturierte Daten aus Bildern wie Nährwerttabellen zu extrahieren
- Best Practices für Claude Vision: Bietet Techniken und Tipps zur Verbesserung der Bildverarbeitungsleistung
- Erste Schritte: Bilder an Claude übergeben: Übermittelt Bilder an die Claude 3 API, um visionbasierte Textanalyse durchzuführen
- Dokumente mit Claude transkribieren: Extrahiert und strukturiert unstrukturierten Text aus Bildern und PDFs
- Arbeiten mit Diagrammen, Grafiken und Foliendecks: Extrahiert mit Claude Vision Informationen aus Diagrammen, Grafiken und Präsentationen
- Multimodal: Führt Bildverständnis und Schlussfolgerungen mit der Anthropic MultiModal LLM-Abstraktion von LlamaIndex aus
- Sprachassistent mit niedriger Latenz mit ElevenLabs: Kombiniert die Speech-to-Text- und Text-to-Speech-Funktionen von ElevenLabs mit Claude
- Audio mit Deepgram transkribieren und mit Anthropic Interviewfragen vorbereiten: Transkribiert Audio und erzeugt mit Claude Interviewfragen
Antworten, Schlussfolgern und Prompting
- Erweitertes Denken: Verwendet Claudes schrittweise erweitertes Denken zusammen mit Budgetverwaltung
- Erweitertes Denken mit Tool-Nutzung kombiniert: Kombiniert erweitertes Denken und Tools in mehrstufigen Workflows
- Prompting für Frontend-Ästhetik: Behandelt das Schreiben von Prompts, die individuelle und ausgereifte Frontends erzeugen, ohne in generische Ästhetik zu verfallen
- Mit Claude zusammenfassen: Fasst juristische Dokumente zusammen, einschließlich Evaluierungen und fortgeschrittener Techniken
- Sampling von Claude-Antworten über das maximale Token-Limit hinaus: Erzeugt lange Antworten über
max_tokenshinaus mit Prefill und Nachrichtenfortsetzung - Metaprompt: Erzeugt Arbeits-Startprompts, um das Problem der leeren Seite zu verringern
- Claude auf „JSON-Modus“ prompten: Erhält zuverlässige JSON-Ausgaben mit Prompting-Techniken ohne constrained sampling
- Batch-Verarbeitung mit der Message Batches API: Verarbeitet große Mengen an Anfragen asynchron und senkt die Kosten um 50 %
Skills und Geschäftsapplikationen
- Claude Skills für Finanzapplikationen: Erstellt Finanz-Dashboards und Portfoliobewertungen mit Excel-, PowerPoint- und PDF-Skills
- Benutzerdefinierte Skills für Claude entwickeln: Erstellt, verteilt und verwaltet Skills, die organisationsspezifische Workflows erweitern
- Einführung in Claude Skills: Führt Dokumentenerstellung, Datenanalyse und Workflow-Automatisierung mit Excel-, PowerPoint- und PDF-Skills durch
- Claude 3 Haiku auf Amazon Bedrock feinabstimmen: Bietet ein Verfahren zur Feinabstimmung von Claude 3 Haiku auf Amazon Bedrock für maßgeschneiderte Aufgaben
- Cookbook zur Admin API für Nutzung und Kosten: Greift mit der Admin API programmatisch auf Nutzungs- und Kostendaten der Claude API zu und analysiert sie
LlamaIndex-Agentenmuster und Community-Beiträge
- ReAct-Agent: Erstellt mit LlamaIndex einen ReAct-Agenten, der toolbasiertes Schlussfolgern und Handlungs-Workflows ausführt
- Community-Beiträge für neue Cookbook-Ideen sind willkommen; dazu gibt es einen Leitfaden für Beiträge
1 Kommentare
Meinungen auf Hacker News
Ehrlich gesagt wirken fast alle Materialien zur Nutzung von KI sinnlos. Wie es geht, kann man die KI direkt fragen; und wenn es um die Nutzung von KI geht, kann man entweder warten, bis Anthropic/OpenAI es in den Harness einbauen oder als triviale Funktion implementieren.
Dinge wie Agenten-Workflows, Memory Management und Harness Engineering fühlen sich größtenteils wie Show an.
Auch neueste KI-Techniken oder Frameworks werden im Drei-Monats-Takt absorbiert oder ersetzt, daher scheint sich die Investition kaum zu lohnen.
.md-Dateien und verschmutzen den Kontext.Am Ende muss man LLMs diese Materialien durchsuchen lassen, also sind es vielleicht eher Materialien für LLMs als für Menschen.
Deshalb meide ich Plugins und MCP, wenn sie nicht unbedingt nötig sind, und nutze ausführliche Prompts. So konnte ich vermeiden, LLMs veraltete Optimierungen aufzuzwingen und ihre Weiterentwicklung zu bremsen.
Die Vorher-Nachher-Bilder zu Frontend-Ästhetik-Prompting sind lächerlich. Offenbar hat niemand überprüft, ob dieser Skill das Design wirklich verbessert hat.
Das Ergebnis von Frontend-Ästhetik-Prompting ist vorher langweilig und nachher langweilig mit hinzugefügten Farbverläufen.
Ich nutze zu Hause die Skills von Matt Pocock, und sie sind ziemlich gut. Sie sind nicht für automatischen Aufruf gedacht, sondern so gestaltet, dass der Nutzer sie selbst aufruft, daher belegen sie nicht viel Kontext nur dadurch, dass sie existieren.
Sie bringen Programmierer eher dazu, stärker über das Ergebnis nachzudenken, statt sie aus dem Endergebnis herauszunehmen. Die grill skills helfen, die tatsächlichen Anforderungen zu klären, und der prototype skill hilft dabei, Bereiche zu erkunden, in denen man schwierige Entscheidungen erst treffen kann, wenn man sie selbst ausprobiert hat.
Auch das OpenAI Cookbook ist nützlich. Andere KI-Labore veröffentlichen ebenfalls häufig Beispiele und Cookbooks auf GitHub und Hugging Face, daher lohnt es sich, weiter hineinzuschauen.
Coding-Agenten liefern im Frontend deutlich häufiger Bugs sowie kaputte, unvollständige oder ungelenke Funktionen als im Backend. Der Grund scheint der Unterschied in der Überprüfbarkeit der beiden Bereiche zu sein, und eine einfache Testsuite reicht nicht aus.
Ansätze wie Garry Tans gstack wirken passend, aber ich weiß nicht, ob sie reif genug für den Einsatz sind. Es gibt auch Einschätzungen, dass Gemini 3.5 Flash bei Frontend-Aufgaben besser sei als Opus oder GPT-5.5; ob das an multimodalen Fähigkeiten oder am Chrome-Verständnis liegt, würde mich aus realen Nutzerbewertungen interessieren.
Für kreative Ergebnisse muss man aktiv danach verlangen, aber für standardmäßiges Frontend-Design ist es gut. Allerdings nutze ich es nur zum Testen von Ideen, nicht zum Hinzufügen oder Ändern beliebiger Funktionen.
Ich dachte, es sei ein echtes Kochbuch, das mit LLMs plausible und tatsächlich kochbare Rezepte erstellt, aber so weit scheint es noch nicht zu sein.
Es macht auch Spaß, nach einem Rezept ein- oder zweimal „mach es leckerer“ zu verlangen und zu sehen, was herauskommt.
Ich dachte, es sei ein neues Produkt, das mit Claude Rezepte generiert.
Die Designs vor und nach Anwendung des Cookbooks sehen beide aus, als seien sie per Vibe Coding erstellt worden. Ich bin kein Designer genug, um die genaue Ursache zu benennen, aber Claudes stilistische Bandbreite scheint etwas begrenzt zu sein.
Wenn man die nötigen Änderungen konkreter vorgibt, lässt sich diese Tendenz vielleicht eindämmen.
Man hätte die UI mindestens einmal überprüfen müssen. Selbst einfache Tabellenabstände sind nicht richtig ausgerichtet.