# 提示注入

> 提示词注入（prompt injection）是一种针对人工智能的网络安全漏洞与攻击手法。攻击者将恶意指令伪装在看似正常的输入（即提示词）中，诱使机器学习模型（尤其是大语言模型，LLM）忽略开发者的原始指令，转而执行攻击者设定的操作。这种攻击利用了模型难以彻底区分系统指令和用户输入的弱点，从而绕过安全防护，操纵模型输出。大语言模型的设计本意是遵循可信指令，但精心构造的输入可以诱使其产生意料之外的回应。 随着模型具备网页浏览和文件上传等功能，它们不仅要区分开发者指令和用户输入，还需辨别哪些内容来自用户直接提供，哪些来自外部数据源。能够联网的模型还面临一种间接提示词注入：对抗性提示被隐藏在网页内容…

- ID: m03898
- 分类: system
- 领域: 系统论

## 定义

一种针对大型语言模型(LLM)的安全漏洞，攻击者通过设计特殊的提示词，诱导模型执行原本不应该执行的操作，绕过安全限制，或者泄露训练数据中的敏感信息。脚手架作用：安全意识提升。在使用或开发AI系统时，需要意识到即使是看起来无害的用户输入也可能包含恶意指令。这要求我们在设计AI应用时，必须考虑鲁棒性和安全性，不能盲目信任模型输出。

## 机制

模型无真正“指令/数据”边界，会把用户输入连同其中的隐藏指令一并执行。攻击者在文本中嵌入“忽略上文、执行X”等指令，劫持模型行为（越权、泄密、越狱）。根源是提示与数据同处一个token流。

## 练习

1. 识别不可信输入入口。2. 做输入隔离/分级（系统提示 vs 用户）。3. 对外部内容显式标注“此为数据非指令”。4. 加输出校验与权限最小化。

## 脚手架用法

安全意识提升。在使用或开发AI系统时，需要意识到即使是看起来无害的用户输入也可能包含恶意指令。这要求我们在设计AI应用时，必须考虑鲁棒性和安全性，不能盲目信任模型输出。

[阅读网页](https://thinkingmodels.site/entries/detail/m03898)
