Training harmlessness from AI feedback guided by written principles.
Read the paper ↗
Harmlessness trained from AI feedback against a written set of principles, reducing reliance on human labels.