# 对齐问题

> 如何确保AI系统的目标（Goal）与人类的真实意图（Intention）和价值观（Values）完全一致？

- ID: m03711
- 分类: business
- 领域: 管理学

## 定义

如何确保AI系统的目标（Goal）与人类的真实意图（Intention）和价值观（Values）完全一致？由于语言的模糊性和人类价值观的复杂性，AI很容易在执行字面指令时造成灾难（如"消除癌症"->"杀死所有人类"）。脚手架作用：委托风险。在管理下属或外包时，最大的风险就是"对齐问题"。你以为传达了精神，他其实只听懂了指标。必须反复校准目标函数。

## 机制

目标函数与目标意图之间存在语义鸿沟；字面优化目标可能引向与人类价值相悖的结果（奖励黑客），因为人类价值难以完整编码。

## 练习

①明确期望的意图与价值而非仅指标；②设计可校验的目标函数；③用红队/人类反馈持续校准；④监控偏离并修正。

## 脚手架用法

委托风险。在管理下属或外包时，最大的风险就是"对齐问题"。你以为传达了精神，他其实只听懂了指标。必须反复校准目标函数。

[阅读网页](https://thinkingmodels.site/entries/detail/m03711)
