A closed-loop control system for Large Language Models that steers internal activation states in real-time to prevent mode collapse and toxicity
reinforcement-learningpytorchcontrol-theoryai-safetyrisermechanistic-interpretabilityllm-steeringactivation-engineering
-
Updated
Apr 8, 2026 - Python