MIT Technology Review · AI· 17:00AI 评分5151我们是否过度信任 AI 说“不”的能力MIT Technology Review 刊文讨论 AI 拒答机制:模型通过微调和分类器学会拒绝有害请求,但拒答本质是概率性的,越狱攻击仍能突破,Anthropic 曾称一类分类器让聊天机器人算力成本增加 24%。观点#大佬观点#安全/对齐#政策/监管