Empirical framework for testing whether RL training instills genuine behavioral dispositions or surface compliance in language models, using compute frugality as a controllable proxy value.
language-modelai-alignmentrlhfmechanistic-interpretabilitybehavioral-alignmentqwen2grpovalue-internalizationalignment-faking
-
Updated
Jul 3, 2026 - Python