MIT Technology Review · AI· Arthur Holland Michel·· 2 天前AI 评分51
我们是否过度信任 AI 说“不”的能力
We’re putting too much faith in AI’s ability to say no
AI 导读
MIT Technology Review 刊文讨论 AI 拒答机制:模型通过微调和分类器学会拒绝有害请求,但拒答本质是概率性的,越狱攻击仍能突破,Anthropic 曾称一类分类器让聊天机器人算力成本增加 24%。
来源:MIT Technology Review · AI · technologyreview.com