跳到正文

技术方向

安全对齐 最新动态

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

82 条精选近 30 天 69 条共收录 521 条

更新

精选归档 · 第 5 页

5月15日周五第 81–82 条
  1. The Register · AI/ML65

    安大略省审计发现医生使用的AI笔记工具常犯基本事实错误

    安大略省审计长办公室对20家获准供应商的AI笔记系统评估发现,这些系统普遍遗漏关键细节、插入错误信息并产生幻觉内容。在模拟医患录音测试中,9个系统编造了治疗建议,12个系统插入了错误的药物信息,17个系统遗漏了患者心理健康的关键细节。报告指出,采购评估标准存在严重问题,医疗笔记准确性仅占总评分的4%,而供应商是否在安大略有本地存在却占30%。

    推荐理由:审计报告揭示了医疗AI笔记工具在关键事实上的系统性错误,以及采购评估标准中存在的权重失衡问题。

5月1日周五
  1. OpenAI Alignment70

    Codex 发布自动审查功能

    Codex 发布自动审查功能,通过独立智能体对越界操作进行审批,将人工审批频率降低约200倍,同时保持99%的批准率和对危险行为的高识别能力。该功能已用于 OpenAI 内部多数桌面端 token 使用,支持在不牺牲安全性的前提下提升自动化效率。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。