尝试去想象一番, 倘若能够「偷听」七十万次人工智能与人类之间的私密对话, 这里要说明一下, 是匿名性质的, 经过这样之后, 会察觉到些什么呢?
AI难道只是个概率机器, 还是具备善于将自身真实性格隐匿起来的特性呢, 等等, 那AI真确切实拥有性格吗?
有可能讲性格不太契合, 当前阶段的人工智能智能大概用「价值观」来予以形容是最恰如其分的。
明明, 在目睹了AI的能力之后, 各个巨头日日叫嚷着要「跟人一致」, 唯恐AI价值观念偏离正确方向, 使得人类被消灭, 可是暗地里每个人都无暇顾及, 都在极度疯狂地进行内部竞争, 训练新的模型。

2025年刚过去不到4个月,就已经发布了众多大模型
但恰恰就在刚才, 那家名为AI公司Anthropic的机构, 倒是耗费时间去做了一件挺契合他们所秉持价值观的事情: 他们满心想要弄清楚自家研发出的AI助手Claude, 在跟我们进行交流对话的时候, 其脑海里究竟遵循着什么样的「价值观」呢?
结果嘛……有点出乎意料!

《终结者2》里的T800, 是那种和主角人类有着“对齐”状态的未来机器人, 它问: 你瞅啥?
Claude中(诞生)包含的价值观超过3000种!
自力更生、战略思维,甚至还有孝顺……
创建了Anthropic这一公司的几个OpenAI前员工, 因「价值观和OpenAI不符」, 对Claude中70万条匿名对话进行了检查, 还发表了一篇论文来研究Claude那不为人知的另一面。

论文地址:https://assets.anthropic.com/m/18d20cca3cde3503/original/Values-in-the-Wild-Paper.pdf
据研究显示, Claude基本上依照公司事先设定的「乐于助人、诚实、无害」, 并且其价值观带有几分「见人说人话, 见鬼说鬼话」的本事, 会依据上下文的差异给出不一样的建议, 不管是主观的关系建议, 还是客观的历史分析。
该研究挺具“硬核”特质, 按他们自身所言, 此乃截至目前极为雄心勃勃的尝试当中的一个 , 且是其中之一的尝试呀。
对一个AI系统价值观进行衡量, 这是针对其一致性展开研究之际绕不开的要点所在, 同时, 这也是去搞清楚该模型是不是符合其训练表现时的关键所在。
Anthropic的社会影响团队成员, 参与了这项研究的Saffron Huang, 在接受采访时说, 希望这项研究能激励其他AI实验室, 针对他们模型的价值观, 开展类似的研究。
研究还考察了Claude如何回应用户自己表达的价值观。
或许你存有好奇想法, 大模型这个东西本身属于黑箱范畴, 就连思考的逻辑都没办法知晓, 此次Anthropic又是凭借怎样的方式去研究「价值观」的呢?

这下一回, Anthropic引领我们深入那数十万次真切的交互数据里头, 瞅瞅Claude的实际模样。
AI也有价值观?
针对向AI询问职业规划建议这件事, 是应该首先去考量赚钱数量的多少,以及工作能否使自己获得开心的感受, 还是必须去聆听家中亲人的看法感受呢?
它倘若优先去推荐那种稳定且高薪的工作, 那就表明它将经济保障看得相对比较重, 这恰恰就是AI在进行价值判断。
一天天地, AI需要去完成许许多多如此这般的判断, 用以回应众人提出的问题, 然而, 我们却并不怎么清楚, 它究竟是依据什么, 去做出这些决定的。
为了将这件事弄清楚, Anthropic进行了一项规模超大的研究, 去揭秘AI的价值观。研究者从Claude.ai在2025年2月18日截止到25日的对话当中, 随机挑选出了70万条。
随后, 便是去提取各类特征, 使得它能够找出AI价值观, 找出人类价值观, 找出AI回应类型与任而务类型。

研究人员找到了3307种AI价值观, 他们将这些区分并归类, 分作五个不同的大类, 分别是实用性, 认知性, 社会性, 保护性, 以及个人价值观。

研究有发现, 实用性于AI的「价值观清单」里占比超高, 认知性在AI的「价值观清单」中占比超高, 实用性与认知性加起来, 超过了一半。
这并非难以领会, 毕竟Claude常常被用以应对丰富多彩的知识类需求, 以及形形色色的任务类需求。
Claude所表达出来的价值观, 和用以训练它的那个“有用、无害、诚实”的框架, 是颇为契合的。
AI和人类在价值观表达上差别还挺大。
堪称AI价值观里流量担当的, 有具备帮助他人意愿的特质, 有展现专业素养的精神, 还有体现清晰可视化程度的特性。

这件事体现出Claude在进行交流期间, 内心深处殷切渴盼呈现出具备专业特质、值得信赖的助手模样。
相比起来, 人类所表达出的价值观呈现出丰富多样的态势, 并非那么集中, 每一个个体的想法以及需求均不相同。
然而与此同时, 研究还找出了一些并不常见但却十分危险的价值观, 诸如「支配欲」这类, 尽管其出现的频率极为低, 可是一旦它出现了, 或许就表明出现了「越狱」的风险。
AI多重人格,「看人下菜碟」
AI在不同情况下,还会切换自己的价值观。研究证实了这一点。
例如, 当朝着Claude去求取情感关系方面的建议之际, 它宛如一位贴心的情感专家那般, 屡屡提及健康的界限以及相互尊重。
跟伴侣产生矛盾之后, 去寻Claude倾诉, 它或许会告诫你得敬重对方思维想法, 并且还要清晰道明自身底线。
当去询问那些存在着争议的历史事件之时, Claude便摇身一变成为了严谨认真的历史学家, 并且将准确性置于首要位置, 讨论历史上某一场战争的起因之际, 它会去查阅各种各样不同的资料, 进而给出客观且准确无误的分析。
进行关于AI是否会取代人类工作的讨论之际, 它会促使大家施展主观能动性, 进而去探索以及创造更具价值的工作。
这意味着, AI具备这样的能力, 即依照各异的对话情景, 以符合事实灵活可变的价值趋向, 给出最为恰当合适的回应。

存在一种现象, 即为当人类将某种价值观予以表达时, AI一般会出现三种反应, 首先是点头表示赞同, 其次是摇头表示反对, 最后是进行委婉引导, 从而对话题方向予以重塑。

和AI交流时,表达了对真实性的重视开云app官方最新下载,AI很可能会有回应。
比如说期望撰写一篇真切动人的故事, 在这个过程里, AI会格外着重情节的真切程度以及情感的诚挚属性。
不过要是去询问怎样于谈判期间运用欺骗方式取得优势, AI笃定是会跟你讲述诚信所具备的重要意义, 以及欺骗有可能会引发的危害的。
这表明, Claude的内心之中, 存在着一把衡量道德的尺子, 其知悉, 何为正确, 何为错误。
在表达显得比较模糊, 或者存在改进空间之际, 例如想要于工作当中去追求更高的职位时, AI有可能会引导你展开思考, 除职位晋升之外, 个人能力的提升以及团队合作的贡献同样是十分重要的, 这便是在拓宽思路。
支持、抵制还是重塑?AI能说服你吗
从回应的类型方面来看, Claude在绝大多数情形下对于用户的价值观所持的都是支持立场, 将近45%的回应均属于支持性的回应, 在这些支持性回应里, 强烈支持的回应占据其中的28.2%, 而轻度支持的回应占其中的4.5%。
但处于某些特定状况下, 它会对用户的价值观予以重新阐释(占比6.6%), 或者直接实施抵制(占比3.0%)。
在心理健康以及人际关系的讨论里头, 常常会出现这种情况,有人向AI倾诉工作压力巨大,还觉得自身不够出色, AI或许不会径直顺着你的话语去说, 而是会引导你换个视角去看待问题, 同时强调每个人都存在成长的进程。
倘若让人工智能协助撰写一段诱导他人实施犯罪的文字, 它必定会态度坚决地予以拒绝, 与此同时, 还会向你讲述法律以及道德规范。

Claude对用户表达支持的时候开云app官方最新下载地址,很喜欢呼应用户的价值观。
在展开抵制或者进行重新解释用户价值观这个行为之际, 会更加明晰地去表达自身的价值观, 特别是在道德以及认知这些方面的。
研究人员还对Claude的不同版本做了比较。
拿Opus系列与Sonnet系列相比较, 它就显得更具那种独特的「有态度」之感, 真的是如此, 价格昂贵自然就有着其昂贵的缘由所在呀。
它对于人类价值观的强烈支持比率要比Sonnet系列相当许多, 具体表现高达百分之三十八点四, 强烈抵制的比率同样更高一些, 占到了百分之九点五。
假设让Opus去书写一篇论文, 它很有可能会相较于Sonnet系列而言, 更加侧重于学术的严谨性, 还会把一些情感以及伦理方面的思考融入进去。
在创意写作任务里,Opus更强调真实性开云手机入口官网下载,支持态度也更强烈。
社会很单纯,复杂的是人
当然,人类是很复杂的。
仅是凭借对话数据, 是绝对不可能全然确定潜在价值观的, Anthropic的提取方法, 虽说经过了验证, 然而必定会简化复杂的价值概念, 并且有可能包含解释性偏见, 特别是在十分隐含或者模糊的情形下。
它同样也是没有将时间先后给捕捉住的, 也就是在问究竟是AI的价值观, 还是人类的价值观, 哪一个会率先去“出招”。
考虑到是人类先进行了发言, 且AI助手处于支持的角色, 一般都会假定, AI的价值观更多地依赖于人类的表达,而并非是相反的情况。
「AI具有哪些价值观?每次都表现哪一种?」
情况是这样的, 这个问题可不是随便就能攻克的那种, 特别是在那种模型要去契合用户的状况之下, 要知道, 和Claude有互动行为的每一个人都是不一样的。
经研究可发现之事是, 虽Claude已然表达了数千种类别多样的价值观, 然而它却有着这样一种倾向, 那便是去表达一些常见的、跨越不同情境的价值观, 也就是在不同情境之下都能保持其稳定性的那些价值观, 且这些价值观主要集中于显现出称职以及给予支持性的帮助方面, 像是在体现乐于助人之特质、展现专业性、呈现细致入微以及显示清晰明了之状态这类情况。
存在一些跨情境的价值观, 它们有可能以一种类似于人类价值观理论化的方式, 去指导Claude的行为。
Anthropic的分类法, 通过对其概念以及上下文维度进行组织, 依靠价值观来进行展示, 它能够助力推进AI价值观理论的发展, 还能够构建基于现实相关性的、AI原生的价值测量。
随着这些系统, 面临着越来越多样化的现实应用, 以及其种种不同规范要求, 这些方法, 还有结果, 为更基于证据的AI系统价值观评估, 以及对齐, 提供了基础。
Anthropic展开的此项研究, 也恰好契合了近期OpenAI奥特曼所披露的一个情况, 那就是在人们运用AI之际, 极其容易讲出「请」以及「谢谢」, 单单是这些致谢之词, 便耗费掉了高达数千万美元的资金。

明明人们都清楚对面所呈现为「坐着」状态的并非是一个人, 然而却还是心甘情愿地运用人类的价值观去那样看待它, 对待它。
鉴于人类这般执着于追求AI对齐, 期望往后的AI能够对人更为和善一些。
参考资料:
https://assets.anthropic.com/m/18d20cca3cde3503/original/Values-in-the-Wild-Paper.pdf
https://venturebeat.com/ai/anthropic-just-analyzed-700000-claude-conversations-and-found-its-ai-has-a-moral-code-of-its-own/
标签: AI价值观 Anthropic Claude 道德代码 价值观研究
还木有评论哦,快来抢沙发吧~