剑桥研究人员开发“对抗性”人工智能测试系统

剑桥研究人员开发“对抗性”人工智能测试系统

大学研究人员发现了人工智能模型中的各种关键缺陷Ryan Teh 代表大学

剑桥大学和加州大学圣塔芭芭拉分校的研究人员调查了为什么某些人工智能模型(例如 Claude 和 ChatGPT)经常产生“幻觉”,产生不准确或捏造的信息。

该研究的结果可能会导致人工智能审查和测试技术的改进,其中包括开发旨在测试人工智能模型“安全性”的“对抗性”数学系统。

该研究发表在期刊上 自然通讯, 使用一种称为“库普曼算子学习”的方法,该方法通过将“复杂的非线性行为转变为更容易分析的线性形式”来研究当前人工智能模型的弱点。

研究人员制作的对抗性测试系统可以帮助人工智能用户和开发人员确定他们是否正在解决可解决的问题,识别可能有效的方法,并避免在人工智能无法解决的问题上浪费时间。

应用数学和理论物理系副教授、该研究的主要作者 Matthew Colbrook 博士表示,该研究的主要目标是“找出难以或不可能预测的系统类型,以及(……)可以调整以返回可靠结果的系统”。

科尔布鲁克和他的合著者发现了机器学习难以分析复杂系统的两个关键原因。首先,算法可能无法判断何时拥有产生准确结果所需的数据。第二是系统中的某些模式可能是隐藏的或难以区分。

Coldbrook 补充道:“在很多人工智能研究中,一个常见的假设是,如果我们收集更多数据,学习最终就会发挥作用。但我们发现这通常是错误的。学习通常是分层的,需要按正确顺序执行多个步骤才能发挥作用。”

使用库普曼算子学习系统,研究人员能够识别可以做出准确短期预测的人工智能系统,但在做出长期预测时很难保持准确,这有助于解释为什么聊天机器人可以自信地生成并向用户转发捏造的答案。

该团队还开发了自己的人工智能算法,他们说该算法的性能优于当前的竞争对手,部分原因在于“内置错误界限”。该算法能够识别研究人员从人工智能获得的答案的准确性,而无需超级计算机,这使其与其他算法区分开来。

科尔布鲁克继续说道:“我们现在所处的阶段,人工智能领域已经出现了很多华而不实的例子和成功故事,但至关重要的是,我们还必须询问模型的确定性如何,以及我们如何知道它们是否确定,否则我们将建立在非常不稳定的基础上。”

Měilíng Lǐ
关于