跳到正文
5月16日周六
  1. Weights & Biases36

    人类参与评估:AI 未来仍需人类

    Weights & Biases 提出人类参与评估是衡量大语言模型效果的关键,强调需理解人类对 AI 的实际体验。该方法主张结合自动化指标与人工反馈,以更全面地评估模型表现。文章指出,当前仅依赖自动化评估可能忽略模型在真实场景中的交互质量与用户感受。

5月11日周一
  1. Replit 博客21

    Mothers who build

    作者 Haya Odeh 在 Replit 博客中分享了作为母亲与职业女性的双重身份如何影响她的领导方式和工作动力。她指出,母亲身份并未削弱她的能力,反而加深了她对团队和环境的判断力。她强调,全职母亲的工作同样是真实且重要的劳动,不应被低估。

5月4日周一
  1. The Register · AI/ML26

    AI 推理正在颠覆数据基础设施规则

    AI 智能体正对云数据基础设施构成前所未有的压力,其推理行为类似 OLTP++,具有超高并发性和不可预测的访问模式。向量数据库与 RAG 应用的瓶颈常在于底层存储和数据访问层,而非 Python 或大语言模型本身。企业必须为极端的 I/O 需求尖峰设计数据路径,并关注 p99/p999 尾部延迟,而非平均延迟。

4月28日周二
  1. Vector Institute25

    Hassan Ashtiani:通过数学基础构建可信 AI

    Hassan Ashtiani 研究如何通过数学证明确保 AI 系统在面对复杂攻击时仍能保持隐私和可靠性。他提出“黑盒约简”方法,可将现有机器学习技术封装进隐私保障框架,无需重新设计算法。该方法已在 NeurIPS 2018 获得最佳论文奖,有助于加拿大在保护隐私的同时推动 AI 发展。

4月24日周五
  1. One Useful Thing68

    Ethan Mollick实测GPT-5.5:模型、应用与工具链的协同进化

    Ethan Mollick基于早期访问体验,评测GPT-5.5在编码、多模态生成和学术写作上的表现。他指出GPT-5.5 Pro在构建3D模拟、生成带文本的图像、撰写学术论文和设计桌游等方面能力显著提升,完成速度从33分钟缩短至20分钟。

    推荐理由:作者通过实测对比展示了GPT-5.5在编码、多模态生成和学术写作上的能力跃迁,读者可据此理解当前AI能力边界与实际应用潜力。

4月11日周六
  1. Sam Altman 博客39

    Sam Altman 博客:AI 工具的潜力与风险、OpenAI 的历程与行业反思

    Sam Altman 在博客中反思了 AI 工具的潜力与风险,强调 AI 将是扩展人类能力的最强大工具,但需警惕其带来的社会焦虑与威胁。他回顾了 OpenAI 成长过程中的成就与冲突,指出公司已从初创发展为重要平台,需以更可预测的方式运作。他认为行业应避免对 AGI 的“控制哲学”,推动技术共享与民主治理,以减少冲突与风险。

4月7日周二
  1. Together AI29

    AI Native Cloud 是什么?

    AI Native Cloud 是为 AI 原生公司构建的专用云平台,旨在解决从预训练、微调、评估到大规模推理的完整 AI 生命周期挑战。它通过垂直整合的 AI 全栈、将前沿研究成果快速产品化的能力,以及支持指数级增长的生态系统,帮助企业在模型质量、延迟、成本和可靠性方面保持竞争优势。

4月1日周三
  1. One Useful Thing39

    Claude Dispatch 和接口的力量

    Anthropic 推出 Claude Cowork 与 Dispatch 接口,允许用户通过手机远程控制桌面端 AI 智能体。用户可从手机发送指令,让 Claude 读取日历、邮件和在线频道,生成晨间简报。Dispatch 与 Claude Code 结合,使 AI 能够直接操作本地文件和应用程序,提升非开发人员的使用效率。

3月28日周六
  1. Replit 博客30

    2026年产品经理最佳AI工具指南

    AI工具正从生产力和能力扩展两个层面重塑产品经理工作流程。Claude、Notion AI和Grammarly等写作工具可快速起草PRD和总结研究,Dovetail和Perplexity能高效分析用户访谈反馈。Replit Agent 4使产品经理能在集成环境中直接将产品意图转化为可运行软件,突破传统开发流程限制。

3月26日周四
3月12日周四
  1. One Useful Thing42

    AI 智能体驱动的软件工厂:工作模式的根本性变革

    StrongDM 公司的三人团队构建了一个完全由 AI 智能体编写、测试和部署生产软件的“软件工厂”,遵循“人类不编写代码”和“人类不审查代码”两条激进规则。该系统将人类制定的产品路线图转化为最终产品,每位工程师每天需消耗相当于其薪资的 AI token(至少 1000 美元)。人类仅对成品进行审查,而无需接触或查看底层代码。

2月19日周四
  1. Bounded Regret46

    Building Technology to Drive AI Governance

    技术专家可通过构建推动AI治理的工具,改变AI研发的底层动态。卫星遥感与连续排放监测等技术使气候治理成为可能,类似地,AI需发展可衡量性与低成本技术以实现可监管性。当前亟需开发模型行为基准、训练计算会计与评估标准,这些技术将使安全实践从被动合规转向经济可行的默认选项。

1月28日周三
1月6日周二
12月30日周二
  1. Ahead of AI34

    2025 年大语言模型发展现状:推理能力、RLVR 和 GRPO 的突破

    2025 年大语言模型领域持续发展,推理模型成为主流,DeepSeek R1 作为开源模型表现出与顶级闭源模型相当的性能,并引入 RLVR 和 GRPO 算法降低训练成本。训练 DeepSeek R1 的成本估计为 294,000 美元,远低于此前预期,但该数字仅涵盖计算资源费用,未包含研究人员薪资等其他成本。各大模型开发者均推出了基于推理的模型变体,推动了模型能力的扩展与优化。

12月21日周日
  1. One Useful Thing44

    AI 能力的形态:锯齿前沿、瓶颈与突出部

    AI 能力存在显著的“锯齿前沿”,即在某些任务上表现超人类而在其他任务上却表现不佳。例如,GPT-4.1 能在两天内完成相当于12人年工作量的医学综述,但在记忆和访问补充文件等任务上仍是短板。这种能力的不均衡性造成了自动化瓶颈,使得超级智能的 AI 目前仍难以完全替代人类。

12月14日周日
  1. Eugene Yan14

    2025 年度回顾:Eugene Yan 的技术写作、原型开发与健康目标

    Eugene Yan 回顾了 2025 年在技术写作、LLM 与 RecSys 融合应用及健康目标方面的进展。他发表了六篇实质性文章,包括关于改进推荐系统与搜索、训练 LLM-RecSys 混合模型等内容,并成功在 Kindle iOS 应用上线了 AI Reading Club(ARC)原型。此外,他坚持每周 5 公里跑步,数据显示其静息心率和 VO2 最大值有所提升。

11月19日周三
  1. One Useful Thing70

    Google 推出 Gemini 3.0 及智能体工具 Antigravity

    Google 发布 Gemini 3.0 模型及配套智能体工具 Antigravity,作者实测其能自主构建交互游戏、分析旧数据并撰写学术论文,通过代码执行和多工具调用完成复杂任务,展现从聊天机器人向数字协作者的转变。

    推荐理由:作者通过实测展示了 Gemini 3 在智能体能力、代码执行和自主研究方面的进展,读者可据此理解其作为数字协作者的潜力与边界。

11月12日周三
  1. One Useful Thing38

    给你的 AI 一次面试:如何通过“氛围”评估其能力

    本文通过模拟“面试”方式测试多个 AI 模型在不同任务中的表现,发现它们在处理特定场景时存在明显差异。Claude 4.5 Sonnet 在写作任务中表现突出,Gemini 2.5 Pro 在计数任务中出现误差,GPT-5 Thinking 风格多变但有时影响连贯性,而 Kimi K2 Thinking 也有类似问题。这种基于“氛围”的测试方式虽具主观性,但能揭示标准化基准难以捕捉的模型特性。

11月4日周二