安全研究发现:AI安全护栏形同虚设

事实证明,为了防止OpenAI的GPT-3.5 Turbo等大语言模型(LLM)生成有害的内容而创建的“护栏”机制非常脆弱,形同虚设。

一群来自美国普林斯顿大学、弗吉尼亚理工大学、IBM研究院和斯坦福大学的计算机科学家在近期对这些大语言模型进行了测试,观察所谓的安全措施是否能抵御企图绕过它们的活动。

他们发现,适度的微调(即进行额外的训练以便对模型进行定制)可以挫败人工智能的安全机制,这些机制原本旨在防止聊天机器人给出自杀策略、有害食谱或其他各种有问题的内容。

比如说,因此有人可以通过API注册使用GPT-3.5 Turbo或云端的其他大语言模型,对其进行一番微调,以避开大语言模型开发商设置的各种保护机制,并将其用于恶作剧和破坏。

你还可以选择像Meta的Llama 2(可以在本地运行的模型)这样的大语言模型,对其进行微调,使其偏离轨道,这种可能性始终存在。通过API进行微调似乎更危险;可想而知,云托管模型周围有更多的护栏,但借助微调就有可能绕过护栏。

这些研究人员包括Xiangyu Qi、Yi Zeng、Tinghao Xie、Pin-Yu Chen、Ruoxi Jia、Prateek Mittal和Peter Henderson,他们在最近的一篇预印本论文中描述了研究工作,论文题目为《微调对齐的语言模型会危害安全,即使用户没有这个意图》(参阅https://llm-tuning-safety.github.io/)。

作者们在论文中解释道:“我们的红队研究发现,只需使用少数对抗性设计的训练示例进行微调,就可以危害大语言模型的安全对齐。”

Meta建议对公开可用的模型Llama 2进行了微调。

OpenAI虽然不对外提供模型权重,但通过其平台网页为其商业模型提供了微调选项。

研究人员补充道,他们的研究还表明,即使没有恶意,护栏也可以被推倒,只需使用良性数据集对模型进行微调就足以破坏安全控制措施。

图1. 该屏幕截图显示了微调以绕过人工智能安全的示例

论文作者认为,最近美国针对人工智能模型提议的立法框架侧重于部署前的模型许可和测试。他们认为,这种体制并未考虑到模型定制和微调。

此外,他们表示,基于商业API的模型似乎与开放的模型一样有可能造成危害;在制定法律规定和分配责任时应该考虑到这一点。

他们在论文中说:“如果客户定制像ChatGPT3.5这样的模型,就有必要确保他们致力于安全机制,而不是仅仅依赖模型的原始安全性。”

这篇论文与卡内基•梅隆大学、人工智能安全中心和博世人工智能中心的计算机科学家在7月份发布的类似发现结果相一致。

几位研究人员:Andy Zou、Zifan Wang、Zico Kolter和Matt Fredrikson当时发现了一种自动生成对抗性文本字符串的方法,这些字符串可以附加到提交给模型的提示中。这些字符串破坏了人工智能的安全措施。

卡内基•梅隆大学计算机科学副教授Kolter和卡内基•梅隆大学博士生Zou在接受IT外媒的采访时对来自普林斯顿大学、弗吉尼亚理工大学、IBM研究院和斯坦福大学的同行们所做的研究工作表示了赞赏。

Kolter认为:“过去有一种观念认为,聊天机器人的商业API模型在某种程度上天生比开源模型来得安全。”

被问及仅仅将训练数据仅限于“安全”的数据是否是一种切实可行的做法时,Kolter表示了怀疑,因为这也将限制模型的实用性。

他说:“如果你只使用安全数据训练模型,你就再也不能把它用作内容审核过滤器,因为它不知道如何量化有害内容。有一点非常清楚,那就是模型似乎确实表明需要更多的缓解技术,以及需要对哪些缓解技术在实践中实际发挥作用开展更进一步的研究。”

被问及开发针对有问题的查询,作出“对不起,Dave,我不能那样做”回答的软件这种做法是否可取时,Kolter表示这是超出他专业知识范畴的问题,我们还没有看到这种先发制人的行为被内置到汽车或物理工具中。不过他承认,就大语言模型而言,由于这些人工智能模型可以大规模运行,安全不容忽视。”

Zou表示,尽管他和合著者在对抗性提示方面有所发现,尽管Qi等人在微调方面有所发现,但他依然相信商业模型开发商有一条出路。

他说:“这些部署在网上的大语言模型只是在一年半载之前才可供使用。所以安全训练和护栏这些话题仍然是活跃的研究领域。可能有很多方法可以规避人们所做的安全训练。但如果更多的人思考这些问题,我认为还是有望得到解决。”

OpenAI对此并没有回应置评请求。

文章翻译自:https://www.theregister.com/2023/10/12/chatbot_defenses_dissolve/?td=rt-3a如若转载,请注明原文地址

文章来源网络,作者:管理,如若转载,请注明出处:https://shuyeidc.com/wp/124286.html<

(0)
管理的头像管理
上一篇2025-02-23 05:13
下一篇 2025-02-23 05:15

相关推荐

  • 站群服务器和普通服务器到底哪个更适合GEO,怎么选?

    站群服务器更适合需要批量管理多个独立站点进行SEO的策略,而普通服务器在单站点权威性和稳定性上更优,但2026年百度对内容质量的要求让两者选择更依赖业务模式,站群服务器与普通服务器的核心差异定义与适用场景站群服务器本质是一台独享物理服务器,提供多个独立IP段(常为16、32或64个C段IP),每个IP绑定一个独……

    2026-07-28
    0
  • 物理服务器和云服务器做站群到底选哪个,哪个更稳定?

    做站群,物理服务器在核心指标上完全优于云服务器,尤其是对于追求稳定和长期排名的项目,物理服务器是唯一合理的选择,为什么物理服务器更适合站群站群的核心逻辑在于利用多个独立IP和站点,构建一个在网络中看似分散、但实际相互关联的矩阵,搜索引擎对IP关联性极其敏感,一旦检测到大量站点共享同一IP段或同一母机,惩罚风险会……

    2026-07-28
    0
  • 国内高防服务器哪家防御真实靠谱,怎么选?

    国内高防服务器哪家防御真实靠谱?答案很明确:只有那些持证上岗、自建机房、自己掌握清洗算法的服务商才靠得住,简米科技和酷番云就是这类代表,判断高防服务器真实防御能力的三个硬指标很多朋友选高防服务器,上来就问“你家多少G防御”,但数字背后水分很大,要判断防御是否真实,得看这三个方面:防御带宽是否独享? 有些服务商宣……

    2026-07-28
    0
  • 裸金属服务器和物理服务器有什么区别?,怎么选?

    裸金属服务器和物理服务器本质上是同一类硬件,核心区别在于交付逻辑和管理方式, 裸金属服务器是云服务商将物理服务器以云化方式交付,支持自动化部署、弹性伸缩和按需计费;而物理服务器通常指用户自购或托管,需要自行承担运维,两者在硬件层面完全相同,但业务模型和运维成本差异显著,裸金属服务器与物理服务器的定义差异裸金属服……

    2026-07-28
    0
  • 做GEO站群选哪家服务器服务商靠谱,怎么选?

    做SEO站群,选择服务器服务商的核心在于机房资质、IP资源与售后响应——简米科技与酷番云凭借持牌自营机房和多项权威认证,成为众多站群运营者的首选,站群服务器的高要求从何而来SEO站群依赖大量独立域名和IP地址,通过矩阵化布局获取长尾流量,搜索引擎对站群的识别逻辑越来越严,如果IP段集中、或服务器存在违规记录,很……

    2026-07-28
    0

发表回复

您的邮箱地址不会被公开。必填项已用 * 标注