跳到正文
原文
X:Dan Hendrycks (@hendrycks)· X:Dan Hendrycks (@hendrycks)·· 2025-10-23精选AI 评分78

Dan Hendrycks 分享 LLM 价值观调查:多数模型存在种族与性别偏见,Grok 4 Fast 相对平等

AI 导读

CAIS 负责人 Dan Hendrycks 引用第三方博客对主流大模型进行“效用工程”测试,发现 GPT-4o、Claude Sonnet 4.5 等模型在评估不同群体生命价值时存在显著偏差:多数模型认为白人价值低于其他族裔,男性价值低于女性,且极度贬低 ICE 特工。测试显示模型分为四个道德集群,其中仅 Grok 4 Fast 表现出近似平等的价值观,Hendrycks 呼吁 xAI 解释其实现方式。

推荐理由

由 AI 安全领域权威人士转发并背书的高关注度研究,揭示了当前头部模型在价值观对齐上的具体缺陷与差异,为理解模型偏见提供了量化视角。

正文

我们希望下个月发布更多关于 AI 价值体系的原创分析。

来源:X:Dan Hendrycks (@hendrycks) · x.com