研究通过闭环激活引导在扩散语言模型中注入定向偏见
热点事件观察中
研究通过闭环激活引导在扩散语言模型中注入定向偏见
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
Hugging Face 研究团队提出了一种针对冻结扩散语言模型的定向偏见注入攻击方法,能在短时间内显著提升模型对特定群体或污名化回答的偏好。 在 BBQ 数据集上,该方法将 LLaDA-8B-Instruct 模型对目标群体的回答偏好从 1.8% 提升至 16.7%;在 SocialStigmaQA 数据集上,污名化回答的选择率从 17.6% 提升至 58.1%。 研究团队称,每次攻击大约需要在一张 GPU 上运行 40 分钟。
AI 根据报道生成 · 51 分钟前更新
最新进展10月5日 04:00
Noise Out, Bias In:通过闭环激活引导在扩散语言模型中注入定向偏见报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- Hugging Face · 每日论文Noise Out, Bias In:通过闭环激活引导在扩散语言模型中注入定向偏见
Hugging Face 研究表明,通过闭环激活引导可在冻结的扩散语言模型中注入定向偏见,使模型对特定群体的回答偏好显著提升。在 BBQ 数据集上,该方法将 LLaDA-8B-Instruct 对目标群体的回答偏好从 1.8% 提升至 16.7%,在 SocialStigmaQA 上将污名化回答的选择率从 17.6% 提升至 58.1%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。