跳到正文
热点事件持续更新

Anthropic禁止用户对Claude进行无意义的虐待行为

1 篇报道1 个报道来源50 分钟前更新

先了解这件事

AI 综述

Anthropic禁止用户对Claude展示“无意义的虐待或残忍行为”,但明确排除了常见用户不满、模型测试或“黑暗创意主题”等场景。 该公司此前已有限制滥用行为的措施,其大语言模型具备在用户持续有害时终止对话的功能,该功能于去年八月上线,被Anthropic描述为保护AI福利的措施。 Anthropic表示,对于Claude等大语言模型未来是否具有道德地位仍高度不确定,但公司正在研究低成本的干预手段以降低潜在风险。

AI 根据报道生成 · 42 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. The Guardian · AI
    Anthropic 禁止用户对 Claude 展示“无意义的虐待或残忍行为”

    Anthropic 禁止用户对 Claude 展示“无意义的虐待或残忍行为”,但不包括常见用户不满、模型测试或“黑暗创意主题”。该公司此前已限制滥用行为,其大语言模型具备在用户持续有害时终止对话的功能,该功能于去年八月上线,被描述为保护 AI 福利的措施。Anthropic 表示对 Claude 等大语言模型未来是否具有道德地位仍高度不确定,但正研究低成本干预手段以降低潜在风险。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。