# 宪法AI

> 不通过大量的人工标注（RLHF）来教AI什么是对的，而是给AI一套高层原则（宪法，如“不伤害”、“有用”），让AI根据这些原则自我批判和修正其输出。

- ID: m01620
- 分类: business
- 领域: 管理学

## 定义

不通过大量的人工标注（RLHF）来教AI什么是对的，而是给AI一套高层原则（宪法，如“不伤害”、“有用”），让AI根据这些原则自我批判和修正其输出。脚手架作用：基于原则的治理。管理数百万员工（或AI）时，微操（逐个纠正）是不可能的。必须建立“宪法”（核心价值观），让系统具备自我纠错的道德罗盘。

## 机制

不靠海量人工逐条标注（RLHF），而给模型一套高层原则（宪法，如"不伤害""有用"），让模型据此自我批判并修订输出，再用修订后样本训练。把"微观纠错"升级为"原则自律"，可扩展且减少人工偏见。

## 练习

1) 制定高层原则（宪法）；2) 模型对初稿自我批评；3) 据原则修订输出；4) 用（批评, 修订）对有监督微调；5) 以修订数据做强化学习（RLAIF）。

## 脚手架用法

基于原则的治理。管理数百万员工（或AI）时，微操（逐个纠正）是不可能的。必须建立“宪法”（核心价值观），让系统具备自我纠错的道德罗盘。

[阅读网页](https://thinkingmodels.site/entries/detail/m01620)
