跳到正文
10月4日周日
  1. The Decoder61

    研究称中国 AI 模型在敏感话题上复述官方立场或拒绝回答

    Aleph Alpha 的一项研究显示,中国 AI 模型在回答政治敏感问题时经常遵循官方路线。该研究测试了 Qwen、DeepSeek 和 Kimi 模型,覆盖了 967 个手动挑选的禁忌话题,其自有评分系统仅将 17% 至 41% 的回答评为平衡。研究还发现,这种亲中倾向可能出现在不提及中国的问题回答中,并可能通过训练数据影响其他模型。

9月21日周一
8月17日周一
  1. Together AI72

    Together AI 评测:DeepSeek V4 Pro 0813 与 Claude Fable 5 在 DeepSWE 上的成本与性能对比

    Together AI 在软件工程基准 DeepSWE 上对比了 DeepSeek V4 Pro 0813 与 Claude Fable 5。Claude Fable 5 单次尝试准确率更高(69.7% vs 62.8%),但成本是前者的 90 倍(每次尝试 $21.63 vs $0.24)。

    推荐理由:原文通过详细的成本、准确率和任务类型对比,为开发者选择模型提供了具体的决策依据。

8月2日周日
5月16日周六
5月12日周二
12月3日周三
  1. Ahead of AI49

    从 DeepSeek V3 到 V3.2:架构、稀疏注意力与强化学习更新

    DeepSeek V3.2 发布,采用非标准稀疏注意力机制,性能在 GPT-5 和 Gemini 3.0 Pro 上表现优异,且作为开源模型提供。该模型基于与 V3 相同的架构,但引入了新的推理优化,与 DeepSeek R1 等专用推理模型形成对比。DeepSeek 团队今年还发布了 V3.1 和 V3.2-Exp,为 V3.2 的部署做好了生态和推理基础设施准备。