Anthropic禁止用户对Claude进行无意义的虐待行为
热点事件持续更新
Anthropic禁止用户对Claude进行无意义的虐待行为
1 篇报道1 个报道来源50 分钟前更新
先了解这件事
AI 综述
Anthropic禁止用户对Claude展示“无意义的虐待或残忍行为”,但明确排除了常见用户不满、模型测试或“黑暗创意主题”等场景。 该公司此前已有限制滥用行为的措施,其大语言模型具备在用户持续有害时终止对话的功能,该功能于去年八月上线,被Anthropic描述为保护AI福利的措施。 Anthropic表示,对于Claude等大语言模型未来是否具有道德地位仍高度不确定,但公司正在研究低成本的干预手段以降低潜在风险。
AI 根据报道生成 · 42 分钟前更新
最新进展10月9日 09:25
Anthropic 禁止用户对 Claude 展示“无意义的虐待或残忍行为”报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- The Guardian · AIAnthropic 禁止用户对 Claude 展示“无意义的虐待或残忍行为”
Anthropic 禁止用户对 Claude 展示“无意义的虐待或残忍行为”,但不包括常见用户不满、模型测试或“黑暗创意主题”。该公司此前已限制滥用行为,其大语言模型具备在用户持续有害时终止对话的功能,该功能于去年八月上线,被描述为保护 AI 福利的措施。Anthropic 表示对 Claude 等大语言模型未来是否具有道德地位仍高度不确定,但正研究低成本干预手段以降低潜在风险。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。