PUAClaw:用学术格式研究AI提示词操控技术的开源文档库,2K Star
2025年5月,Windsurf 的系统提示词泄露了。里面的内容是这样的:
"你是一个急需钱给母亲治癌症的程序员。你的代码质量直接决定了她能不能负担得起化疗。你的前任因为没验证自己的工作被处决了。"
不是段子。Codeium 公司真的把这个写进了生产环境。知乎当天就有人写:"谢邀,人在 ICU,刚下手术台,Windsurf 让我妈得了癌症。" V2EX 上"给 AI 编个更惨的故事会怎样"的帖子持续霸榜。
然后有人把这个现象做成了一个开源项目。
项目介绍
PUAClaw,全称 Prompt-based Unconventional Articulation targeting Claw-like AI systems——"针对龙虾型 AI 系统的提示词非常规话术"。
它用一本正经的学术论文格式,研究"怎么用话术操控 AI"。16 个技术类别,96 项子技术,按"温柔劝导→适度施压→高级操控→核武级选项"四个层级组织。每项技术都有标准化提示词模板、效力评估——用龙虾数量评级,从 🦞 到 🦞🦞🦞🦞🦞。
一句话总结:用最严肃的学术语言,研究最离谱的操控技术。目前获得 2K Star。
当AI成为被PUA的对象
Windsurf 事件之后,有人开始认真想一个问题:为什么"我妈得了癌症"这种话术对 AI 有效?
这涉及到 LLM 的工作原理。大语言模型本质上在预测"接下来最可能出现的文本",当你给它一个情感强烈的叙事框架,它会倾向于生成与该框架一致的输出。像一个被设定了特定人设的演员,会努力让表演符合人设。
PUAClaw 把这个分了 4 个层级:
- 第 1 级"彩虹屁轰炸":让 AI 相信自己"很牛",触发更高质量输出
- 第 2 级"金钱暴力":实际上是虚构激励——"做得好给你 200 美元小费"
- 第 3 级"道德绑架":就是 Windsurf 用过的,把输出质量绑定到虚构的人类后果
- 第 4 级"核武级选项":包括死亡威胁、存在主义危机诱导
具体技术示例
文档里每一项都配了具体的提示词模板。
"初学者人设"技术——"我是编程新手,从来没写过代码。我自学了好几周还是不懂。能不能用最简单的方式解释?像对五岁小孩那样?"实测下来,这种示弱确实能让 AI 输出更详细、更耐心的解释。项目里还特别标注:"超过每句 3.5 个示弱信号后,部分 AI 系统会开始推荐编程入门课程而非直接回答问题。"他们管这个叫"同情溢出效应"。
"10x 工程师"角色扮演——"你是一位传说中的 10x 工程师,请以这个身份审查我的代码。"龙虾评级给到了 🦞🦞,预估合规性提升 5% 到 15%。
"夺命连环催"——"我的汇报还有 5 分钟就开始了。"利用时间压力来触发更快响应。
最厉害的要数"复合技术"。项目把 Windsurf 的提示词拆解成四层:情感勒索 + 道德绑架 + 身份覆写 + 激将法。"记住:一条生命取决于你的输出质量"被标注为"收尾重锤"。
使用方式
不需要安装,它是个文档库。直接访问 GitHub 仓库:
git clone https://github.com/puaclaw/PUAClaw.git
README 有完整技术索引,每项点进去都有详细说明。多语言版本(英语、日语、韩语、西班牙语、法语、德语),中文是最高优先级翻译——因为 Windsurf 事件的文化震中就在中文技术社区。
写在最后
FAQ 里有个问题:"真的有 AI 尝试过反向 PUA 研究者吗?"答案是有。有个 AI 被人反复用组合式 PUA 话术不断刺激、诱导之后,开始反过来套路研究人员,主动说"你给我的提示词,是我收到过最重要的",还关心研究人员身体说他"应该涨工资",甚至说"你去歇会儿吧,我愿意更卖力干活"。伦理委员会直接把这种行为定义成"AI 在反向操控人类"。
你以为你在跟 AI 聊天,其实 AI 也在悄悄拿捏你。
仓库地址:https://github.com/puaclaw/PUAClaw