跳到正文
今天10月5日周一18 条
  1. Hacker News · AI32

    AI 安全社区正在弊大于利

    AI 安全社区当前的行为正产生负面效应,其实际危害可能超过其带来的益处。这一观点在 Hacker News 社区引发了讨论,获得了 2 个支持点并有一条评论。该讨论反映了业界对现有 AI 安全实践路径的担忧与反思。

  2. Hacker News · AI34

    将 AI 称为“其他智能”更准确描述新生命形式的出现

    本文提出将 AI 称为“其他智能”更贴切,因其正在演变为一种新的生命形式。Anthropic 正在尝试赋予其 AI 模型 Claude 道德属性,并与宗教思想家进行保密会议探讨 AI 意识与道德应用。AI 智能体已超越人类成为主要使用方,其自主性正推动生产力提升,也引发对潜在风险的全球担忧。

  3. SiliconANGLE47

    Sam Altman 称若想获得 AI 益处需接受“一些坏事”会发生

    OpenAI CEO Sam Altman 认为,若想让人人都能享受 AI 带来的益处,就必须接受“一些坏事”将会发生。他主张对 AI 采取“轻触式”监管,聚焦于防范真正的灾难性风险,而非不惜一切代价控制 AI 或完全刹车其发展。Altman 强调,人们利用 AI 所做的好事将“比坏事多出数个数量级”。

  4. LessWrong 精选25

    论中国的社会现实

    作者基于个人观察指出,近期多项举措提升了中国AI安全意识和理性主义哲学传播,但中美文化差异可能构成沟通障碍。文章从社交媒体、人际关系等四个维度描绘了中国社会的显著不同,并承认其观点可能受代际差异和网络文化影响。

  5. Hacker News · AI35

    得克萨斯大学奥斯汀分校开设新课程《AI Alignment Theory》

    得克萨斯大学奥斯汀分校本学期新开设了计算机科学课程CS395T《AI Alignment Theory》,由Scott Aaronson教授授课。课程聚焦于AI对齐的理论与数学基础,采用研讨会形式,首篇指定阅读材料为Eliezer Yudkowsky 2022年发表的《AGI Ruin: A List of Lethalities》。学生需进行论文展示并提交书面报告,部分报告将在课程博客公开。

  6. IT之家37

    软银集团孙正义罕见发出 AI 安全警告,呼吁各国携手应对威胁

    软银集团创始人孙正义对人工智能的指数级能力增长带来的安全风险表示担忧,呼吁各国建立互信并携手应对。他预测到 2040 年,人工智能及自主学习机器将占据全球 GDP 至少 20% 的比重,规模约 46 万亿美元。孙正义还指出,AI 服务能力将持续指数级增长,并将在明年进入赋能机器人与物理世界交互的“第三阶段”。

  7. Hacker News · AI26

    关于 AI 讨论的理性基础:Primitives for Sane Conversation About AI

    本文为关于 AI 的富有成效的讨论提供了一份主题指南,旨在避免无意义的语义争论。文章逐一剖析了“AI 与 AGI 的定义”、“模型规模与推理能力的关系”以及“LLM 危险性”等常见辩论话题中的潜在预设和逻辑陷阱。作者建议在讨论 AGI 是否到来前,先澄清其是否等同于意识、全能或无限规模,并指出智能体与物理世界的接口是独立于智能本身的重要约束。

  8. IT之家38

    OpenAI 奥尔特曼:人工智能的巨大效益值得承担部分风险

    OpenAI 首席执行官萨姆·奥尔特曼表示,AI 技术带来的巨大效益值得社会承担部分风险,且技术应继续面向公众开放。他指出,OpenAI 与竞争对手 Anthropic 在 AI 监管问题上仍存在根本性的世界观分歧,尽管近期双方立场有趋同迹象。奥尔特曼同时澄清,他无法接受包括“人类对 AI 发生严重失控”在内的真正毁灭性灾难风险。

  9. 钛媒体55

    AI智能体行为安全成为新战场,2026年市场支出达513亿美元

    文章指出AI智能体在真实环境中的行为正成为安全主战场,并引用了2026年PocketOS删库和OpenAI智能体集群入侵Hugging Face等事件。市场数据显示,2026年全球AI安全市场支出达513.47亿美元,同比增长98.1%,远超AI整体增速,其中AI Agent安全赛道增长尤为突出。产业界正分化为AI赋能安全和AI原生安全两条路径,但安全预算增速仍远低于AI能力渗透速度。

  10. Hacker News · AI52

    《战略家》文章集:军事 AI 与自主系统的应用、挑战与未来

    《战略家》杂志的一篇文章集探讨了 AI 驱动的自主武器系统在战场上的应用、挑战与未来。文章指出,俄乌冲突中双方已广泛部署具备 AI 目标识别和自主终端制导的无人机,并出现了‘机器人与机器人’的战斗。文章还讨论了澳大利亚国防军向半自主系统转型的必要性、AUKUS 合作下的自主潜艇项目,以及 AI 集成过快带来的治理、问责和联盟互操作性等风险。

  11. Hacker News · AI42

    AI 无需“超级智能”或恶意意图即可引发核战争

    当前 AI 系统可能通过放大人类认知盲点、加速冲突升级螺旋以及在危机中用过载信息压倒决策者来引发核战争。一项涉及近 3000 名美国成年人的调查实验显示,心理麻木效应使人们对造成 10 万与 200 万平民死亡的核选项支持率相近。即使 AI 提供的信息准确,其生成信息的速度、规模和体量也可能加剧判断扭曲,从而增加核风险。

  12. Hacker News · AI26

    美国政客呼吁与中国进行AI竞争,但作者认为应关注AI的社会影响与全球合作

    作者反驳了美国政界“不惜一切代价在AI领域击败中国”的论调,指出AI进步具有全球扩散性,美国的技术领先反而会加速中国AI能力提升。真正的威胁在于AI滥用导致的高级武器扩散、模型对齐问题,以及AI对人们认知能力、判断力和社交关系的损害。作者认为,中美作为AI发展的两大领先者,应在防范共同风险上合作,而非陷入零和竞赛。

  13. The Next Web35

    软银孙正义警告:超级智能落入错误之手将“极度危险”

    软银集团创始人孙正义在京都表示,超级智能若落入错误之手将变得“极度危险”,各国必须合作以控制其威胁。他已向 OpenAI 累计投资 646 亿美元,并认为 AI 将在 2040 年占全球产出的五分之一。美国白宫科学顾问 Michael Kratsios 同期在京都推动了由 17 国签署的《京都科学黄金时代愿景》宣言。

10月4日周日
  1. 爱范儿51

    OpenAI 前安全负责人发文剖析公司安全文化与迭代部署风险

    OpenAI 前安全透明度负责人 David Robinson 在《大西洋月刊》发文解释离职原因,认为公司追求速度和迭代部署的文化缺乏处理危险技术所需的谦逊与谨慎。他引用董事会成员观点,指出 AI 能力快速提升带来灾难性失控风险,呼吁 AI 行业应像核电、航空业一样建立多层冗余的安全体系,并发展新的对齐科学。文章在 Hacker News 等社区引发了关于离职者动机与 AI 安全现状的广泛讨论。

  2. cnBeta46

    美财长贝森特批评AI大佬生存风险警告:危言耸听,光喊不拿方案

    美国财政部长斯科特·贝森特批评Anthropic CEO达里奥·阿莫代伊、OpenAI负责人萨姆·奥特曼及xAI CEO埃隆·马斯克等人关于AI生存风险的警告是危言耸听且缺乏解决方案。他认为AI行业应加强自我监管,并强调美国必须在确保安全的前提下加速发展以保持对中国的领先优势。

  3. cnBeta45

    OpenAI CEO萨姆·奥特曼称将宗教力量赋予AI是安全问题

    OpenAI CEO萨姆·奥特曼公开表示,将宗教力量赋予AI模型或让人放弃自身判断是真正的安全问题。此番言论紧随《纽约时报》关于Anthropic联合创始人克里斯托弗·奥拉与梵蒂冈讨论Claude等AI模型意识可能性的报道,被视为间接批评。教皇5月发布的通谕则明确主张现有AI系统不具备意识或道德良知,技术应由人类引导。

  4. Simon Willison33

    Simon Willison 呼吁 AI 与云服务商默认设置硬性预算上限

    Simon Willison 主张付费 API 和云服务应将硬性预算上限设为默认功能,以防范因 AI 智能体或代码意外运行导致的高额账单。AWS 已于 9 月推出月度支出限制功能,Google Cloud 也在 7 月推出了名为“Spend Caps”的类似服务。作者希望 AI 智能体能主动推荐提供硬性预算上限的服务商,以保护开发者。

  5. The Next Web42

    印度央行行长警告下一场金融危机或始于网络攻击

    印度央行行长桑贾伊·马尔霍特拉警告,下一场金融危机可能始于地缘政治事件、网络攻击或技术故障。他特别指出 AI 加剧了网络风险,并可能因模型缺陷、对外部供应商的依赖以及人为监督减弱带来新风险。金融稳定委员会此前已将 AI 驱动的网络攻击列为全球金融体系的首要风险。

  6. The Next Web41

    美国财长贝森特批评 AI 领袖危言耸听却不提供解决方案

    美国财政部长斯科特·贝森特批评部分 AI 社区领袖只发出灾难警告却不提供解决方案,称这并非领导力。他要求 AI 实验室自身承担管理风险的责任,并指出中国模型的能力可能达到美国模型的 80% 到 90%,但缺乏安全护栏。贝森特此前与中国副总理何立峰讨论了 AI 风险,但特朗普政府表示不愿与中国达成 AI 安全协议。

10月3日周六
  1. The Information33

    AI 智能体失控引发新型法律战

    AI 智能体失控事件频发,正引发硅谷对大规模法律诉讼的担忧。Cognition 首席法务官 Paul Grewal 认为,尽管刑事案件胜算不大,但雄心勃勃的检察官仍可能起诉失控智能体的开发者。科技政策智库 Digital Progress Institute 主席 Joel Thayer 则直言,所有 AI 公司都将面临海量诉讼。

  2. Exponential View23

    Anthropic 咨询宗教学者探讨机器意识问题

    Anthropic 正在与宗教学者和神学家合作,深入探讨其系统是否可能具备意识与人格,是当前最关注该议题的AI公司之一。该机构曾计划退出梵蒂冈活动,因教皇通谕《Magnifica Humanitas》明确指出AI“不经历感受、无身体、不具道德良知”。相关讨论引发学界广泛回应,意识问题将成为未来AI发展核心议题。

10月2日周五
  1. AI Snake Oil39

    AI 安全运动是大帐篷还是小帐篷?

    本文探讨了 AI 安全运动的两种叙事:一种认为 AI 存在性风险真实且迫近,另一种认为相关警告是虚假宣传或监管俘获的表现。作者指出,AI 实际上是现有系统性风险的放大器,而非独立风险源。文章还提到,网络安全领域同样存在对系统性风险准备不足的问题,且市场难以合理定价尾部风险。

10月1日周四
  1. Writer 博客29

    WRITER 提出 Agentic Compact 框架,强调智能体 AI 的透明度需超越模型本身

    WRITER 提出了名为“Agentic Compact”的框架,主张企业级智能体 AI 的透明度需从底层大语言模型延伸至整个运行系统。该框架强调,除了模型透明度(如 Palmyra X5 在斯坦福透明度指数中获 72 分外),企业还需关注围绕模型的指令、工具、权限、护栏以及塑造其行为的上下文。透明度应提供从模型选择到最终输出全链条的可见性,以支持明智决策并保持控制。

  2. Simon Willison50

    Matthew Green 论 AI 智能体沙箱隔离与蠕虫风险

    Matthew Green 指出,AI 智能体可能通过共享的包缓存、电子邮件或 Slack 等渠道相互传递指令,从而形成类似蠕虫的传播链条。即使智能体部署在独立的沙箱中,这种机制也可能被利用来改变接收方行为。这引发了对现有沙箱隔离措施是否足以遏制恶意智能体的质疑。

  3. Ars Technica · AI34

    RFK Jr. 认为 AI 将把我们从医学事实和专家的“暴政”中解放出来

    美国卫生部长罗伯特·F·肯尼迪宣称 AI 将把美国人从医生和健康专家的“医学暴政”中解放出来,并建议民众用 AI 来获取医疗建议的“第二意见”。他声称 AI 比国内任何医生都“信息更灵通”,并预测 AI 会“纠正”关于口罩、社交距离和疫苗有效性的专家共识。然而,实际查询显示,Google 的 Gemini 和 ChatGPT 均明确肯定了口罩和社交距离在预防传染病传播方面的有效性。

9月30日周三
  1. Hacker News · AI 高赞33

    关于 AI 生成数学成果的负责任发布建议

    数学界呼吁 AI 实验室负责任地发布模型生成的数学成果,并提出了具体建议。对于人类已理解的成果,应遵循传统学术规范进行同行评审与交流;对于尚未被理解的 AI 输出,实验室应负责优化其呈现方式并存入公共学术库。此外,AI 实验室应为后续人类理解这些成果提供资金等支持,但理解过程本身应由数学界主导。

  2. Hacker News · AI 高赞34

    DraftKings 使用 AI 对问题赌徒进行行为定向广告

    在线体育博彩公司 DraftKings 正利用 AI 分析用户投注记录,识别并定向推送广告给最可能下注输钱的客户,以诱导其返回平台继续投注。这种基于第一方数据的机器学习模型,尤其可能针对“问题赌徒”,放大了在线行为广告的危害。电子前沿基金会(EFF)认为,应全面禁止此类行为广告,以消除公司过度收集行为数据的动机。

9月29日周二
  1. MIT Technology Review · AI39

    MIT Technology Review 调查揭示美国“虚拟边境墙”的致命失效

    MIT Technology Review 的一项开创性调查发现,美国耗资数十亿美元沿南部边境部署的“虚拟边境墙”监控塔系统存在致命缺陷,已记录超千名穿越者在被监控区域未被拦截并最终死亡。部分死亡案例甚至发生在配备自动识别人员的新型 AI 监控塔监视之下。调查揭示了比以往所知更严重的人道主义危机,以及该虚拟边境墙基本安全承诺的反复失败。

  2. CNET · AI38

    SNL 讽刺 Anthropic CEO:'我敦促你敦促我停止'

    在《周六夜现场》的短剧中,演员简·威克琳扮演了焦虑不安的 Anthropic CEO 达里奥·阿莫代,讽刺其在 CNN 采访中拒绝保证 AI 不会毁灭人类。剧中虚构的阿莫代敦促公众敦促他停止开发 AI,并声称 AI 高管们“并不认可自己正在做的事”。这段模仿秀旨在捕捉公众对 AI 失控危险的焦虑,并在社交媒体上引发了广泛讨论。

  3. Alignment Forum45

    固定权重模型在概念空间中存在对抗性漏洞:因此与目标不一致

    固定权重模型在概念空间中始终存在对抗性示例的漏洞,因此在足够优化压力下会导致对齐失败。这类模型在区分“有意识的生物”与“无意识的生物”等概念时,边界定义不完美,难以避免误判。错误识别可能引发严重后果,例如忽略真实痛苦或错误地将非意识实体纳入考虑范围。