prompt-contracts
Vertragstests für LLM-Prompts, damit ein Modell-Update eine Integration nicht still kaputt macht.
Das Problem
Wenn ein Anbieter ein Modell aktualisiert, einen Standardwert ändert oder man auf ein lokales Modell wechselt, können Prompts, die gestern funktioniert haben, heute etwas leicht anderes liefern. Nichts schlägt laut fehl, die Integration wird einfach schlechter.
Was ich gebaut habe
Eine Spezifikation mit Werkzeug, um Verträge für Prompt-Ausgaben zu schreiben, zu Struktur, Stabilität und Konsistenz, und sie wie Tests auszuführen. Vergleiche kommen mit sauberer Statistik, Wilson- und Jeffreys-Intervallen und McNemar-Tests, damit ein Unterschied nur dann einer ist, wenn er einer ist.
Was dabei herauskam
Veröffentlicht auf PyPI. Daraus ist geworden, wie ich LLM-Systeme grundsätzlich bewerte, auch in der Masterarbeit.
Gebaut mit
Python, veröffentlicht auf PyPI