1 Punkte von jsb4702 8 시간 전 | Noch keine Kommentare. | Auf WhatsApp teilen

In einer Branche, in der erfundene Teilenummern oder stillschweigend falsche Berechnungen bis in Zeichnungen, Stücklisten und Bestellungen gelangen können,
arbeite ich seit einiger Zeit und behandle LLM-Antworten wie Dokumente mit „kein Versand vor bestandener Prüfung“: Dafür habe ich einen Harness
gebaut, den ich seit einigen Monaten produktiv nutze. Veröffentlicht ist ein kuratierter Snapshot, aus dem persönliche und domänenspezifische Informationen entfernt wurden.

  • 13 Arten von Verifikations-Gates vor dem Ausgeben von Antworten: Blockieren von Halluzinationen (keine geschätzte Generierung von Teilenummern oder DOIs),
    erneute Ausführung von Arithmetik in Bash, Isolation von Prompt Injection, Abgleich mit tatsächlicher Tool-Ausgabe bei Behauptungen wie „ausgeführt“,
    sowie ein Wiederholungsvermeidungs-Gate, das Fehlerfälle als Regression-Goldset festschreibt
  • Jede zentrale Zahl, jedes Zitat und jede Kausalbehauptung erhält eine von drei Vertrauensstufen — Zitate aus dem Gedächtnis
    höchstens Gelb, Grün nur bei tatsächlicher Abfrage
  • Sicherheitskritische Schlussfolgerungen werden mit heterogenen Modellen (Gemini, Groq, OpenAI CLI) parallel neu hergeleitet und anschließend auf Konvergenz
    geprüft — unter der Annahme, dass Self-Checks desselben Modells dieselben blinden Flecken teilen
  • Supply-Chain-INTAKE-Pipeline, die externe Skills/Plug-ins erst nach Isolation → statischem Scan → menschlicher Durchsicht → Rebuild übernimmt
    (auch natürlichsprachliche Anweisungen werden als Bedrohung auf Code-Niveau behandelt)
  • Neue Prüfer laufen zunächst im Shadow Mode zur Messung der False-Positive-Rate und werden danach hochgestuft; verifizierte Aussagen werden in ein Register übernommen,
    um Widersprüche automatisch abzugleichen

Die Gate-Hooks und Prüfer sind tatsächlich lauffähiger Python-Code, Regressionstests sind ebenfalls enthalten.
Klonen und ohne zusätzliche Abhängigkeiten direkt ausführen:
python3 eval/tests/test_g9_regression.py --hook hooks/g9_arith_enforce.py
python3 hooks/tests/test_glossary_hook.py
Wenn die Hooks über settings.example.json verdrahtet werden, funktionieren die Gates auch in der eigenen Umgebung.
Es ist keine Komplettdistribution, die man als Ganzes übernimmt, sondern so aufgebaut, dass Hooks und Prüfer einzeln ausgewählt und eingebunden werden können.
Ein Großteil der Dokumentation ist auf Koreanisch, Architektur und README sind auf Englisch.

Noch keine Kommentare.

Noch keine Kommentare.