Safe RLHF: Constrained Value Alignment via Safe Reinforcement Learning from Human Feedback
reinforcement-learningtransformerstransformersafetyllamagptdatasetsbeaveralpacaai-safetysafe-reinforcement-learningvicunadeepspeedlarge-language-modelsllmllmsrlhfreinforcement-learning-from-human-feedbacksafe-rlhfsafe-reinforcement-learning-from-human-feedback
-
Updated
Nov 24, 2025 - Python