我们是否过度信任 AI 说“不”的能力
MIT Technology Review 刊文讨论 AI 拒答机制:模型通过微调和分类器学会拒绝有害请求,但拒答本质是概率性的,越狱攻击仍能突破,Anthropic 曾称一类分类器让聊天机器人算力成本增加 24%。
MIT Technology Review 刊文讨论 AI 拒答机制:模型通过微调和分类器学会拒绝有害请求,但拒答本质是概率性的,越狱攻击仍能突破,Anthropic 曾称一类分类器让聊天机器人算力成本增加 24%。
MIT Technology Review 与 Aventine 合作的文章指出,尽管马斯克称 Tesla Optimus 未来可能以低至 2 万美元单价自动化几乎所有人类劳动、并预测 2027 年底前向公众发售,但许多机器人研究者对此持怀疑态度。