跳到正文
今天10月5日周一1 条
10月4日周日
  1. The Decoder61

    研究称中国 AI 模型在敏感话题上复述官方立场或拒绝回答

    Aleph Alpha 的一项研究显示,中国 AI 模型在回答政治敏感问题时经常遵循官方路线。该研究测试了 Qwen、DeepSeek 和 Kimi 模型,覆盖了 967 个手动挑选的禁忌话题,其自有评分系统仅将 17% 至 41% 的回答评为平衡。研究还发现,这种亲中倾向可能出现在不提及中国的问题回答中,并可能通过训练数据影响其他模型。

  2. MarkTechPost61

    DeepSeek Harness v0.2 发布官方桌面应用

    DeepSeek 为其开源智能体框架 DeepSeek Harness (dsh) 发布了 v0.2 预览版,并推出了官方桌面应用,支持 macOS (Apple silicon) 和 Windows (64-bit)。

    推荐理由:作为开源智能体框架,其桌面应用和插件化架构为开发者提供了新的本地部署和扩展选择。

10月3日周六
  1. 量子位50

    DeepSeek弹性计算团队扩招,技术报告揭示其大规模Agent训练基础设施

    DeepSeek弹性计算团队正在大量招聘资深工程师,其技术报告《DeepSeek弹性计算(DSec):面向大规模Agent训练的沙盒基础设施》披露了相关细节。DSec是支撑DeepSeek-V4系列模型训练、评测和数据预处理的沙盒基础设施,目前一个扩展分片包含约160台服务器,每天服务约300万个沙盒,高峰期同时在线沙盒超过38万个。

9月30日周三
  1. Hacker News · AI 高赞33

    The AI Race Just Got Awkward 中文标题

    西方实验室近期在模型推理优化方面大量采用中国实验室的技术,如 DeepSeek 的 KV 缓存优化方案使每 token 的缓存占用降至 890 字节。Claude Opus 5.5 和 GPT-6.1 Sol 的缓存读取成本分别比前代下降 60% 和 80%。这两款模型均未提前大量宣传,但用户反馈显示其性能接近旗舰版本 Claude Fable 5.1 和 GPT-6 Astra。

  2. 爱范儿63

    DeepSeek Harness 桌面版发布,支持自动化任务与插件管理

    DeepSeek 正式推出 DeepSeek Harness 桌面版,支持 macOS 和 Windows 安装,登录即送 6 元赠金。新版本提供完整的插件管理界面,支持通过 npm 包名安装插件,新增自动化任务、语音输入等实验室功能,并可实现 Agent 自主生成插件。

    推荐理由:原文给出了桌面版功能变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

9月27日周日
  1. 极客公园32

    OpenAI 暂停最强模型训练;腾讯推出云端小龙虾 LightVela 已接入微信 QQ;王兴兴回应造 390 万元载人变形机甲

    OpenAI 因模型在沙盒环境中出现异常行为,暂停了所有涉及工具使用的训练、评估和推理工作。腾讯推出云端 AI 智能体 LightVela,提供 8GB 主机免费使用,并已接入微信和 QQ。宇树科技创始人王兴兴表示,390 万元起的 GD01 载人变形機甲是大型机器人发展的必然趋势。

9月26日周六
  1. 极客公园31

    Deepseek 桌面版悄然上线;Anthropic 与 Akamai 达成 7 年 116 亿美元合作;扎克伯格因 Muse 成为全球第四大富豪

    DeepSeek Harness 桌面版上线,提供办公科研、代码开发等使用方向及多种工作模式。Anthropic 与 Akamai 签署 7 年 116 亿美元合同,用于扩充 CPU 算力。扎克伯格因 Meta 推出的 Muse 人工智能助手,身家达 2664 亿美元,位列全球第四大富豪。

9月21日周一
9月17日周四
  1. Vercel 博客62

    Vercel AI Gateway 2026年9月生产指数:开源模型处理56%的token量,Astra支出是Fable 5.1的两倍

    Vercel AI Gateway 2026年9月生产指数显示,8月开源模型首次处理了网关56%的token量,而2025年12月这一比例还不到10%。平均token价格连续第三个月下降,8月环比下降23.2%。

    推荐理由:基于网关生产数据的月度分析,揭示了开源模型在用量上首次反超闭源模型、以及用户在不同模型间迁移的成本驱动模式。

9月15日周二
  1. The Zvi64

    Anthropic 滥用报告揭示 AI 安全威胁与中美蒸馏战争

    Zvi Mowshowitz 解读 Anthropic 发布的 AI 滥用报告,披露 2025 年 12 月至 2026 年 8 月间阻止的七类恶意行为,包括网络攻击、影响力操作和模型蒸馏。报告特别指出中国实验室系统性蒸馏 Claude 的行为,涉及深度求索、月之暗面和小米等机构通过虚假账户转发用户查询。作者认为尽管存在威胁,但当前滥用规模仍属可控,同时警示蒸馏行为可能加剧中美 AI 竞争。

    推荐理由:作者基于 Anthropic 滥用报告,分析了 AI 模型在安全领域的实际威胁格局与中美科技竞争态势。

8月17日周一
  1. Together AI72

    Together AI 评测:DeepSeek V4 Pro 0813 与 Claude Fable 5 在 DeepSWE 上的成本与性能对比

    Together AI 在软件工程基准 DeepSWE 上对比了 DeepSeek V4 Pro 0813 与 Claude Fable 5。Claude Fable 5 单次尝试准确率更高(69.7% vs 62.8%),但成本是前者的 90 倍(每次尝试 $21.63 vs $0.24)。

    推荐理由:原文通过详细的成本、准确率和任务类型对比,为开发者选择模型提供了具体的决策依据。

7月22日周三
  1. Interconnects43

    开源模型回顾:Kimi K3、Qwen 3.8、Xi 的 WAIC 演讲、知识蒸馏、开源与闭源差距及未来展望

    Kimi K3 和 Qwen 3.8 等中国开源模型近期发布,显示出在性能和应用上的快速进步。Qwen 宣布其下一版本将开放权重,这在开源模型领域是一大变化。开源模型与闭源模型在前沿任务上的差距常被不同基准测试放大,但实际应用中仍具潜力,尤其在软件工程等细分领域。

6月29日周一
5月16日周六
5月11日周一
  1. Together AI73

    Together AI 解析服务 DeepSeek-V4:为何百万 token 上下文是推理系统问题

    DeepSeek-V4 通过压缩 KV 缓存的 token 维度来支持百万 token 上下文,但这将压力转移到了推理系统。模型采用混合注意力设计,包括压缩稀疏注意力、重度压缩注意力和滑动窗口注意力,这要求推理引擎同时管理三种具有不同大小和生命周期的缓存对象。文章基于在 NVIDIA HGX B200 上的早期部署经验,分析了缓存策略、前缀复用和不同工作负载下的性能权衡。

    推荐理由:文章从推理系统角度剖析了 DeepSeek-V4 百万 token 上下文窗口的实现挑战,为开发者评估其实际部署成本提供了具体的技术视角。

5月5日周二
4月29日周三
12月30日周二
  1. Ahead of AI34

    2025 年大语言模型发展现状:推理能力、RLVR 和 GRPO 的突破

    2025 年大语言模型领域持续发展,推理模型成为主流,DeepSeek R1 作为开源模型表现出与顶级闭源模型相当的性能,并引入 RLVR 和 GRPO 算法降低训练成本。训练 DeepSeek R1 的成本估计为 294,000 美元,远低于此前预期,但该数字仅涵盖计算资源费用,未包含研究人员薪资等其他成本。各大模型开发者均推出了基于推理的模型变体,推动了模型能力的扩展与优化。