GroundingExperten
GroundingPI: Präzises visuelles Grounding als Perzeptionsfundament für physische Intelligenz
In einem Preprint wird GroundingPI vorgestellt, ein 4-Milliarden-Parameter-Grounding-Foundation-Model, das Punkte und Boxen als quantisierte Koordinaten in einem gemeinsamen Vokabular erzeugt. Über 34 Grounding-Benchmarks mit 44 Baseline-Vergleichen erreicht das Modell einen Durchschnitt von 73,68 % und liegt damit vor dem größeren GPT-6 Astra mit 71,54 %. Als Perzeptionsbackbone verbessert es Robotermanipulation und autonomes Fahren, etwa mit bis zu 24,8 % relativem Vorteil im RoboTwin-2.0-OOD-Setting.