FailBank: Self-Evolution von Vision-Language-Action-Modellen durch Laufzeit-Feedback
FailBank ist ein vierstufiges Self-Evolution-Framework, das Laufzeit-Feedback einer CBF-basierten Sicherheitskomponente in persistente Policy-Verbesserungen für Vision-Language-Action-Modelle umwandelt. Ein Preprint auf arXiv berichtet, dass FailBank die Aufgabenerfolgsrate gegenüber den Basispolicies um 8,5 bzw. 6,9 Prozentpunkte steigert und die policy-induzierten kumulativen Kosten um 35,6 bzw. 23,8 Prozent senkt. Damit wird gezeigt, dass Laufzeitkorrekturen nicht nur temporäre Eingriffe, sondern auch Trainingssignal für künftiges Verhalten sein können.