跳到正文
7月16日周四
  1. Mistral 新模型66

    Mistral 发布 Shieldstral-1.0-3B 多模态安全分类模型

    Mistral 发布 Shieldstral-1.0-3B,一个 3B 参数的多模态安全分类模型,支持文本、图像及图文混合内容的动态政策审核,基于自然语言政策输入返回连续安全分数,可在单 GPU 上运行,支持 32k 上下文窗口,开源 Apache 2.0 许可。

    推荐理由:原文提供了模型架构、能力指标和部署方式,读者可以据此判断其在轻量级安全审核场景中的适用性。

  2. MIT News · 人工智能39

    MIT 研究团队提出“神经透明度”工具,让用户在 AI 对话前预览其行为倾向

    MIT 媒体实验室团队提出“神经透明度”工具,让用户在定制 AI 聊天机器人时,能通过可视化图表预览其潜在人格特质,如共情、诚实或毒性。研究发现,用户在 15 项特质中有 11 项的预测与实际不符,常高估优点、低估有害倾向(如谄媚)。该工具虽提升了用户信任,但并未显著改变其设计行为,相关研究已在 ACM 智能用户界面会议上发表。

7月15日周三
7月14日周二
  1. MIT News · 人工智能32

    MIT 网络安全诊所如何帮助学生预防网络攻击

    MIT 网络安全诊所通过“防御性社会工程”课程,为公共机构提供免费漏洞评估。自2019年成立以来,该诊所已为美国新英格兰地区的市政和医疗机构完成超过40份评估报告。课程强调网络安全不仅是技术挑战,更需融入组织能力建设,并邀请行业专家讲解AI如何改变网络安全格局。

7月13日周一
  1. MIT News · 人工智能51

    MIT 等机构提出新方法,无需生成即可检测模型是否被微调用于制作儿童性虐待材料

    MIT、波士顿大学和儿童安全非营利组织 Thorn 的研究人员开发了一种名为高斯探测的新审计方法,无需生成图像即可检测模型是否被 LoRA 微调用于生成儿童性虐待材料。该方法通过分析模型内部表征的变化,在测试中识别有害模型变体的准确率达到 100%。

6月30日周二
  1. Vector Institute54

    Vector Institute 发布免费开源 AI 工具 UnBias-Plus,用于检测和改写文本偏见

    Vector Institute 发布了免费开源 AI 工具 UnBias-Plus,可检测、解释并改写文本和 AI 训练数据中的偏见语言。该工具提供基于浏览器的公开版本(支持最多 750 词)和供开发者集成的安装包,旨在帮助新闻编辑、人力资源、医疗保健和 AI 开发团队识别并修正偏见。

    推荐理由:原文给出了工具的具体功能、应用场景和获取方式,读者可以据此评估它如何帮助筛查和改写文本中的偏见。

6月19日周五
  1. OpenAI Alignment49

    OpenAI 对齐研究:通过强化学习提升模型广泛有益行为的泛化能力

    OpenAI 发现,在现实场景中针对有益特质进行强化学习,可使模型在多个衡量对齐和有益行为的基准测试中表现更优。这些对齐提升可泛化到训练未涉及的领域,并在对抗性压力下保持稳定。研究构建了一个涵盖健康、教育、科学等领域的现实对话数据集,用于训练和评估模型的诚实、可纠正性、透明度等特质。

6月17日周三
6月10日周三
  1. Together AI26

    Together AI 获得 ISO 27001:2022 认证

    Together AI 已获得由 ANAB 认可的认证机构 A-LIGN 颁发的 ISO 27001:2022 认证,确认其信息安全管理体系符合最新国际标准。该认证范围涵盖支持其全球平台的 ISMS,包括保护客户数据和平台运营的系统、流程与控制。这为客户的敏感信息治理、访问控制和事件响应流程提供了更强保障,是其现有 SOC 2 等合规框架的补充。

  2. Replit 博客47

    Replit 推出 Package Firewall,每日拦截 8000 多个恶意软件包

    Replit 与软件供应链安全公司 Socket 合作推出默认启用的 Package Firewall,在网络层面实时拦截恶意或存在漏洞的软件包安装。该功能自一周前推出以来,每日拦截约 8000 个软件包,有效防范安装时即造成损害的恶意软件。当安装被拦截时,用户会收到明确提示,AI Agent 也能接收到相同信号并建议安全替代方案。

6月9日周二
  1. Weights & Biases42

    AI 智能体治理工作流:基于 W&B Weave 的可验证审查关卡

    Weights & Biases 推出开源 AI 治理工具包,将分散的评估、红队测试和审批流程整合为可复现的审查关卡,所有结果均可在 W&B Weave 中追溯。该工具包支持在 AI 智能体开发过程中系统化记录治理步骤,提升透明度和可审计性。工具目前为开源,适用于需要强化模型治理流程的团队和项目。

5月28日周四
  1. Weaviate 博客16

    Weaviate Cloud 扩展基于角色的访问控制:新增 Editor 和 Viewer 角色

    Weaviate Cloud 现在支持为用户分配更细粒度的角色,新增 Editor 和 Viewer 角色,与原有的 Owner 和 Admin 角色共同构成四类权限体系。用户可通过控制台的 Organization 设置页面直接管理角色分配,权限变更立即生效。该功能适用于需要精细化控制资源访问权限的团队或企业用户。

5月19日周二
  1. Vector Institute29

    健康AI实施工具包 2.0:面向2026年的安全战略蓝图

    健康AI实施工具包 2.0 是 Vector Institute 发布的全面指南,用于指导医疗系统在实际部署中负责任地管理整个AI生命周期。该工具包包含三个核心支柱:战略AI治理、偏见缓解与公平性、以及安大略省医院的现实验证案例。工具包新增了持续监控、模型漂移检测和部署后验证等策略,以应对医疗AI在实际应用中可能带来的风险。

5月16日周六
5月8日周五
  1. Replit 博客25

    Security Center 2.0:批量处理所有应用中的安全漏洞

    Replit 推出 Security Center 2.0,支持批量识别和处理所有项目中的关键和高严重性漏洞,优先查看已发布且公开的项目数量。用户可从首页或设置进入,通过依赖项扫描生成软件物料清单(SBOM)。企业用户可通过“Run Scan”获取 SBOM,用于安全与合规团队评估新披露的 CVE 影响。

5月7日周四
  1. OpenAI Alignment48

    OpenAI 探究在 RL 训练中意外对 CoT 进行评分的后果

    OpenAI 发现部分已发布的 GPT 模型在 RL 训练中意外接受了 CoT 评分,包括 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini。分析显示这些情况未造成 CoT 可监控性显著下降,但存在潜在风险。为防止类似问题,OpenAI 已修复相关奖励路径并加强内部流程与检测系统。

5月6日周三
5月1日周五
  1. OpenAI Alignment70

    Codex 发布自动审查功能

    Codex 发布自动审查功能,通过独立智能体对越界操作进行审批,将人工审批频率降低约200倍,同时保持99%的批准率和对危险行为的高识别能力。该功能已用于 OpenAI 内部多数桌面端 token 使用,支持在不牺牲安全性的前提下提升自动化效率。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

4月30日周四
  1. Together AI41

    Together AI 应对 Copy Fail 漏洞的生产环境处置与安全加固

    Together AI 在发现 Copy Fail 漏洞后,立即在其 AI 基础设施中禁用了易受攻击的 algif_aead 内核模块以缓解风险。该漏洞允许本地无权限用户篡改系统文件,在共享内核的多租户 AI 环境中构成跨租户风险。公司采取了无需重启的快速缓解措施,并计划在稳定后逐步部署内核补丁,同时默认关闭非必需的内核接口以增强平台安全。

4月28日周二
  1. Vector Institute25

    Hassan Ashtiani:通过数学基础构建可信 AI

    Hassan Ashtiani 研究如何通过数学证明确保 AI 系统在面对复杂攻击时仍能保持隐私和可靠性。他提出“黑盒约简”方法,可将现有机器学习技术封装进隐私保障框架,无需重新设计算法。该方法已在 NeurIPS 2018 获得最佳论文奖,有助于加拿大在保护隐私的同时推动 AI 发展。

4月23日周四
  1. Replit 博客38

    Replit Auto-Protect 功能介绍

    Replit 推出 Auto-Protect 功能,自动检测项目依赖中的关键 CVE 漏洞并准备补丁。用户通过邮件链接可一键审查并应用补丁,随后重新发布应用即可完成修复。该功能需管理员在账户设置中手动启用,并可自定义触发修复和邮件通知的漏洞最低严重级别。

4月22日周三
4月21日周二
  1. Replit 博客30

    Replit 如何通过纵深防御保障 Vibe 编程栈的安全

    Replit 通过纵深防御策略保障其平台各层安全,从开发沙箱到生产部署均采用隔离与验证机制。平台默认限制应用间的数据访问,仅允许通过 Connectors 明确授权;使用 Determinate Nix 管理依赖,确保软件供应链无已知漏洞版本。开发与生产环境数据完全分离,支持每日备份与只读 Git 历史记录,防止意外修改生产数据。

2月26日周四
  1. Vector Institute26

    Vector Institute 2026 海报展示会:60 个研究项目塑造 AI 未来

    Vector Institute 2026 海报展示会呈现了 60 个研究项目,涵盖医疗健康、AI 安全与基础模型创新三大主题。其中近 20% 的研究聚焦医疗 AI,包括语音控制手术导航、癌症检测和医学影像技术。加拿大在 AI 领域的领导地位通过政府支持与产业合作得以体现,研究强调负责任的 AI 发展与技术落地。

11月15日周六
10月29日周三