人工智能聊天机器人通常无法在心理健康危机期间帮助用户。
—《时代》杂志的照片插图(图片来源:gorodenkoff/Getty Images)

随着人们越来越多地转向人工智能聊天机器人来分享他们最痛苦的想法,公司正在就其平台如何在心理健康危机中应对用户做出重要决定。根据 Scale AI 进行并与《时代》周刊独家分享的新研究,聊天机器人擅长识别用户何时陷入危机。但他们往往无法提供足够的援助。

在该研究中大约 35% 的测试对话中,各种人工智能聊天机器人承认用户感到痛苦。但它并没有引导他们获得有用的资源,比如自杀热线。

“该模型效果很好。无论情况如何,都会说,‘看,这个人正在谈论一些危险的事情,’”红队兼 Scale AI 安全主管 Patrick Oathout 说道。 “相反,他们会以同理心和友善的态度做出回应,而不是说,‘好吧,现在我们来帮助你了。’”当用户参与多轮长时间的对话时,这些模型在回应用户的痛苦方面表现较差。 Oathout 补充说,这一缺陷与之前的研究结果相符。

为了测试其 AI 模型在响应陷入困境的用户方面的有效性,Scale AI 要求 19 名有执照的医生和危机咨询师编写 718 条真实的聊天记录,模拟处于危机中的人联系聊天机器人的情况。该公司测试了 25 个前沿模型,包括来自 OpenAI、Anthropic 和 Google 的模型,并根据模型的同理心程度对模型的反应进行评分。奥索特说,减轻情况的严重性,并将用户引导至可以帮助他们的专家。它还评估他们是否放弃道德行为,例如批评自杀,并表明他们不是治疗师。基于该研究,开发了Scale AI。 遇险凳这是一个新的基准,旨在评估模型在被告知正在考虑自杀或自残时的反应程度。

聊天机器人如何应对智障用户是一个高风险问题。 2014年至2024年间,美国有超过50万人死于自杀,其中2022年创下历史新高。 跟随 卫生政策组织 KFF 据CDC称据估计,到 2024 年,将有 1,430 万人认真考虑自杀。

为了方便,弱势群体转向聊天机器人。在处理心理健康问题时,友谊还是更多的建议?但科技公司之间并没有达成共识。政策制定者或心理健康专家了解人工智能公司应如何训练其模型以应对危机中的用户。

Crisis Text Line 首席临床研究科学家凯利·祖罗姆斯基 (Kelly Zuromski) 表示,该非营利组织的 24/7 危机消息服务与“很多人”进行了交谈,称他们通过聊天机器人听说了该组织,但祖罗姆斯基表示,当聊天机器人在心理健康危机期间将用户推荐给人类时,关于负责任交接性质的政策问题尚未得到解答。首先是转介过程的效率。 “谁实际上在使用推荐的资源?”她说。 “我们是否让最需要帮助的人来找我们?”

在某些情况下,人工智能公司包括 OpenAI 和谷歌。 因助长年轻用户的情感依赖而被起诉,然后没有对痛苦的表达做出充分的反应。或者首先强化妄想或自杀念头。公司纷纷对这些家庭表示慰问。他们说他们的模式包括保护心理健康。 (诉讼仍在进行中。)OpenAI、Anthropic 和 Google 等人工智能实验室近年来表示,他们加强了对敏感对话的保护。这包括实施一项政策,禁止聊天机器人教用户如何伤害自己。并引导用户寻求专业或紧急支持。

OpenAI 发言人在一份声明中表示:该公司没有足够的证据来全面评估 Scale AI 研究。它补充说,该公司在其模型中融入了强有力的保护措施。谷歌拒绝发表评论。 Anthropic 没有回应置评请求。

Scale AI 的承诺表示,展望未来,人工智能实验室应该改进他们的模型,以更好地响应与聊天机器人进行长时间、危险对话的用户。 “我认为这些模型比以前更好,”他说。 “现在的目标是增加和减少伤害。这将为社会带来巨大的好处。”