Agenten, die über Architektur streiten
Meine Masterarbeit untersucht, ob LLM-Agenten, die über eine Softwarearchitektur debattieren, sie besser bewerten als ein einzelnes Modell.
Das Problem
Eine Softwarearchitektur ordentlich zu bewerten, etwa nach ATAM, ist langsame Expertenarbeit. Sprachmodelle können Teile davon übernehmen, und wenn mehrere von ihnen debattieren, sollen sie besser schlussfolgern. Der Haken daran ist, dass ein großer Teil dieses Vorteils verschwindet, sobald das einzelne Modell dasselbe Rechenbudget bekommt.
Was ich gebaut habe
Ein Multi-Agenten-System, in dem Agenten mit verschiedenen Rollen über Architekturvarianten für Microservice-Systeme streiten und am Ende liefern, was eine ATAM-Bewertung liefert, nämlich Risiken, Sensitivitätspunkte, Trade-offs und eine Empfehlung. Vorher habe ich 871 Studien ausgewertet. Keine davon hat eine Debatte auf Architekturbewertung angewendet, und nur 45 von 360 Debatten-Studien haben gegen eine Baseline mit gleichem Budget verglichen. Deshalb tritt die Debatte im Experiment gegen ein einzelnes Modell und gegen wiederholtes Sampling zu gleichen Kosten an, gemessen an veröffentlichten Bewertungen menschlicher Experten.
Was dabei herauskam
Literaturreview und Auswertungspipeline sind fertig. Das Experiment läuft im Oktober und November 2026, abgegeben wird Anfang 2027. Jede Zahl in der Arbeit lässt sich auf eine Datei, ein Skript und einen Commit zurückführen.
Gebaut mit
Python, LLM-APIs, uv, pytest, ein systematisches Literaturreview
Ich schreibe sie am Herman Hollerith Zentrum der Hochschule Reutlingen. Sobald es Ergebnisse gibt, stehen sie hier.