Behavioral evaluation framework for sentience-, emotion-, and welfare-related AI claims, with anti-sandbagging analysis.
alignmentai-safetyllm-evalsmodel-welfarebenchmark-integritybehavioral-evaluationsentience-evalsevaluation-research
-
Updated
Mar 24, 2026 - Python