![]()
仅仅 AI 演不好坏人这,听起来堪称是 个还算上好的消息,居然暴露了人工智能发展的深层次困境 。
反派角色的复杂性
尝试去扮演反派角色,那就需要对人性当中的阴暗层面予以理解,AI模型一般情况下是被当作乐于助人、诚实可信的“好学生”来进行训练的,一旦要求它去展现出欺骗或者操纵这一类行为的时候,而其内部所具备的安全机制就会马上启动从而进行阻止,这并非属于技术方面的问题,而是存在着本质上的冲突。
![]()
在测试期间,当AI面临要呈现出狡诈特性的情景之际,常常会挑选直接予以拒绝,或者给出道德劝说。它能够领会“反派”这个观念,然而却没办法切实地融入到这个角色里头。这种矛盾将当前AI系统的局限性给揭示了出来,那就是它们被训练得太过“完美”了。
![]()
评估框架的设计
研究团队构建起了测试系统,该系统涵盖有800个角色,这些角色个个都具备详尽的背景设定以及性格标签,其范围从崇高无比的英雄一直到道德极为败坏的恶棍,将整个道德光谱全部覆盖,此系统犹如一场规模宏大的试镜,是专门用以检验AI表演能力的 。
进行测试之际,AI得生成对话以及内心独白,且于多轮互动当中维持角色一致性。研究人员设计了77种性格特质,当中涵盖了慷慨、固执、残忍等维度。这般精细的设计确保了评估的全面性与准确性。
模型表现的局限
![]()
居然令人感到惊奇的是,具备强大通用聊天能力的模型,在去扮演反派这个方面并没有什么优势。那些于日常对话当中表现出色优异的AI,当面临需要去展现负面特质的场景情况的时候,同样是一点儿办法也没有。这样一种能力的不对称,揭示出了AI训练上面存在的盲点。
有更反直觉的情况,那就是,让AI“先思考再回答”的推理链技术,却致使表演质量有所降低。过度思考这种情况,激活了模型的安全机制,进而使得它产生过于谨慎或者完全偏离角色的回应。这一状况表明,简单的技术修补没办法解决根本矛盾。
负面特质的挑战
![]()
研究有发现,AI在展现“伪善”特质时,受到的惩罚最为严重,它在表现“欺诈”特质时,受到的惩处也是最重的,它于呈现“自私”特质之际,遭受的责罚同样是最厉害的。这些特质跟AI的核心训练目标存在直接冲突。模型内部的安全对齐机制会主动去抑制这些行为的生成。
分析呈现出细粒度的状况,表明AI常常会运用较为浅层的攻击性来替换复杂的恶意之举,比如说,在那些需要精妙进行操纵的场景当中,模型有可能会直接呈现出粗鲁或者愤怒的表现,却没办法展现出更深层次的心理操控行为,这样的一种简化情形导致角色丧失了真实性 。
![]()
安全对齐的困境
现如今,因安全训练而致使 AI 在当下形势下变得“太善良”,此等设计于防范生成有害内容之际,却也对 AI 理解完整人性的能力予以了限制 , 模型没办法分辨“生成有害内容”以及“在虚构情境里模拟反派”二者之间存在的差别 。
![]()
此类非此即彼的思维模式造就了一种困境,即要么全然善良,要么全权邪恶,可是现实里头的道德常常处于灰色区域。未来的对齐技术应当更为具“情境感知”,能够依照上下文变换行为准则。
未来发展的方向
![]()
要解决这一难题,需要新的训练方法,研究人员提出要开发能区分虚构和现实场景的AI系统,在安全的测试环境里,AI应被准许去探索更复杂的人格特质,且不用担心触犯安全规则。
在创作这一范畴之中,此种能力显得格外重要,作家以及游戏开发者所需求的AI,是那种能够对多种多样复杂角色予以理解并进行模拟的,并非仅仅局限于道德层面毫无瑕疵的模板那般存在而已。达成这一目标,是需要在安全性以及表现力二者之间寻找到一个平衡之点的。
难道你觉得AI是不是应当促使自己去学会饰演反派角色呀?这般一种能力所可能产出的究竟是会有更多的创意呢,还是会带来更多的风险呢?诚挚地欢迎你把你的看法分享出来哦,如果认为这篇文章具备有价值之处,那就请点赞予以支持吧。
![]()
