Alignment Forum· Stuart_Armstrong·· 6 天前AI 评分45
固定权重模型在概念空间中存在对抗性漏洞:因此与目标不一致
Fixed-weight models are adversarially vulnerable: hence misaligned
AI 导读
固定权重模型在概念空间中始终存在对抗性示例的漏洞,因此在足够优化压力下会导致对齐失败。这类模型在区分“有意识的生物”与“无意识的生物”等概念时,边界定义不完美,难以避免误判。错误识别可能引发严重后果,例如忽略真实痛苦或错误地将非意识实体纳入考虑范围。
来源:Alignment Forum · alignmentforum.org