跳到正文
2月12日周四
  1. Andrej Karpathy71

    Andrej Karpathy发布200行Python实现的microGPT教程

    Andrej Karpathy发布名为microGPT的教学项目,仅用200行无依赖Python代码实现了完整的GPT训练和推理流程。该项目包含数据集处理、Tokenizer、自动微分引擎、GPT-2类似架构、Adam优化器等核心组件,并附有逐步构建指南。代码已在GitHub Gist和Colab笔记本开源,训练后能生成类似训练数据的虚构人名。

    推荐理由:作者用200行Python代码完整实现了GPT训练和推理流程,适合希望理解Transformer底层原理的开发者。

1月24日周六
1月22日周四
1月10日周六
  1. Berkeley AI Research37

    Berkeley AI Research 提出基于信息论的成像系统设计与评估框架

    Berkeley AI Research 在 NeurIPS 2025 论文中提出一个直接评估和优化成像系统信息内容的新框架。该信息度量统一了分辨率、噪声和光谱灵敏度等传统分离的质量指标,能准确预测彩色摄影、射电天文、无透镜成像和显微镜四个领域的系统性能。优化该指标产生的设计与最先进的端到端方法性能相当,但所需内存和计算量更少,且无需特定任务的解码器设计。

1月6日周二
12月30日周二
  1. Ahead of AI34

    2025 年大语言模型发展现状:推理能力、RLVR 和 GRPO 的突破

    2025 年大语言模型领域持续发展,推理模型成为主流,DeepSeek R1 作为开源模型表现出与顶级闭源模型相当的性能,并引入 RLVR 和 GRPO 算法降低训练成本。训练 DeepSeek R1 的成本估计为 294,000 美元,远低于此前预期,但该数字仅涵盖计算资源费用,未包含研究人员薪资等其他成本。各大模型开发者均推出了基于推理的模型变体,推动了模型能力的扩展与优化。

12月12日周五
12月3日周三
  1. Ahead of AI49

    从 DeepSeek V3 到 V3.2:架构、稀疏注意力与强化学习更新

    DeepSeek V3.2 发布,采用非标准稀疏注意力机制,性能在 GPT-5 和 Gemini 3.0 Pro 上表现优异,且作为开源模型提供。该模型基于与 V3 相同的架构,但引入了新的推理优化,与 DeepSeek R1 等专用推理模型形成对比。DeepSeek 团队今年还发布了 V3.1 和 V3.2-Exp,为 V3.2 的部署做好了生态和推理基础设施准备。

  2. Vector Institute13

    Vector 研究人员在 NeurIPS 2025 发表 80 篇论文,推动 AI 前沿发展

    Vector 研究人员在 NeurIPS 2025 会议上提交了 80 篇论文,涵盖下一代基础模型、扩散生成系统、强化学习突破和隐私保护联邦方法等多个领域。其中提出 ActiveVOI 框架,用于开放世界智能体的主动知识获取,显著优于现有基于大语言模型和视觉语言模型的规划方法。另一项研究引入连续时间流图蒸馏方法,通过自引导和对抗微调提升性能,适用于不同步数的生成任务。

11月25日周二
11月23日周日
  1. Eugene Yan46

    Product Evals in Three Simple Steps

    本文提出构建产品评估的三步法:标注小数据集、对齐大语言模型评估器、运行实验与评估框架。建议从二元通过/失败标签开始,以提高标注一致性并简化对齐过程。优先收集50-100个失败案例,可通过较小模型生成或主动学习识别潜在失败样本。

11月15日周六