Zum Inhalt springen
Philippos MelikidisRegion Stuttgart, Oktober 2026

2026 · Forschung

Wo im Code steckt der Fehler?

Ein Benchmark mit 918 echten GitHub-Issues, der misst, wie gut verschiedene Suchverfahren die Datei finden, die repariert werden muss.

Das Problem

Bevor jemand ein Issue beheben kann, Mensch oder KI-Werkzeug, muss er die richtige Stelle im Code finden. Viele Verfahren versprechen das. Fair auf echten Daten verglichen werden die wenigsten.

Was ich gebaut habe

Ein Hochschul-Teamprojekt mit zwei Engineers und einer Forschungsgruppe. Mein Teil waren die Ground-Truth-Pipeline und ihre Validierung, das Framework zum Vergleich der Anfragemodi, die Statistik, die Auswertung von Code vor und nach ChatGPT und das Tooling, mit dem ein lokales LLM Suchanfragen erweitert.

Was dabei herauskam

Der eigentliche Hebel war, ein LLM wahrscheinliche Funktions- und Dateinamen zur Anfrage hinzufügen zu lassen, nicht die aufwendigere zweistufige Suche, und der Unterschied ist statistisch signifikant. Die Validierung der Ground Truth zeigte außerdem, dass der erste Datensatz nur 149 eindeutige Issues unter 206 Einträgen enthielt, was mehrere Schlüsse verändert hat.

Gebaut mit

Python, Elasticsearch, Embedding-Modelle, ein lokales LLM, Bootstrap-Statistik

Quellcode auf GitHub

← Alle Arbeiten