人类参与评估:AI 未来仍需人类
Weights & Biases 提出人类参与评估是衡量大语言模型效果的关键,强调需理解人类对 AI 的实际体验。该方法主张结合自动化指标与人工反馈,以更全面地评估模型表现。文章指出,当前仅依赖自动化评估可能忽略模型在真实场景中的交互质量与用户感受。
Weights & Biases 提出人类参与评估是衡量大语言模型效果的关键,强调需理解人类对 AI 的实际体验。该方法主张结合自动化指标与人工反馈,以更全面地评估模型表现。文章指出,当前仅依赖自动化评估可能忽略模型在真实场景中的交互质量与用户感受。
fal 公司阐述了其在 AI 基础设施领域的信任与安全策略。该公司已集成 Thorn 技术主动检测并移除儿童性虐待材料,并与 StopNCII.org 合作打击非自愿亲密图像。其策略强调在明确违规时立即行动,并着眼于构建能够承受长期压力的系统性解决方案。
作者 Haya Odeh 在 Replit 博客中分享了作为母亲与职业女性的双重身份如何影响她的领导方式和工作动力。她指出,母亲身份并未削弱她的能力,反而加深了她对团队和环境的判断力。她强调,全职母亲的工作同样是真实且重要的劳动,不应被低估。
AI 智能体正对云数据基础设施构成前所未有的压力,其推理行为类似 OLTP++,具有超高并发性和不可预测的访问模式。向量数据库与 RAG 应用的瓶颈常在于底层存储和数据访问层,而非 Python 或大语言模型本身。企业必须为极端的 I/O 需求尖峰设计数据路径,并关注 p99/p999 尾部延迟,而非平均延迟。
Together AI 在 NVIDIA GTC 2026 上深入探讨了生产环境中 AI 推理的挑战与优化策略,指出推理成本占生产系统全生命周期成本的 80-90%,是决定 AI 原生公司单位经济效益的关键。
Hassan Ashtiani 研究如何通过数学证明确保 AI 系统在面对复杂攻击时仍能保持隐私和可靠性。他提出“黑盒约简”方法,可将现有机器学习技术封装进隐私保障框架,无需重新设计算法。该方法已在 NeurIPS 2018 获得最佳论文奖,有助于加拿大在保护隐私的同时推动 AI 发展。
Ethan Mollick基于早期访问体验,评测GPT-5.5在编码、多模态生成和学术写作上的表现。他指出GPT-5.5 Pro在构建3D模拟、生成带文本的图像、撰写学术论文和设计桌游等方面能力显著提升,完成速度从33分钟缩短至20分钟。
推荐理由:作者通过实测对比展示了GPT-5.5在编码、多模态生成和学术写作上的能力跃迁,读者可据此理解当前AI能力边界与实际应用潜力。
Sam Altman 在博客中反思了 AI 工具的潜力与风险,强调 AI 将是扩展人类能力的最强大工具,但需警惕其带来的社会焦虑与威胁。他回顾了 OpenAI 成长过程中的成就与冲突,指出公司已从初创发展为重要平台,需以更可预测的方式运作。他认为行业应避免对 AGI 的“控制哲学”,推动技术共享与民主治理,以减少冲突与风险。
AI Native Cloud 是为 AI 原生公司构建的专用云平台,旨在解决从预训练、微调、评估到大规模推理的完整 AI 生命周期挑战。它通过垂直整合的 AI 全栈、将前沿研究成果快速产品化的能力,以及支持指数级增长的生态系统,帮助企业在模型质量、延迟、成本和可靠性方面保持竞争优势。
Together AI 的 kernels 团队通过开发 FlashAttention 和 ThunderKittens 等核心软件,将 Transformer 注意力计算速度提升了 2-3 倍。
Anthropic 推出 Claude Cowork 与 Dispatch 接口,允许用户通过手机远程控制桌面端 AI 智能体。用户可从手机发送指令,让 Claude 读取日历、邮件和在线频道,生成晨间简报。Dispatch 与 Claude Code 结合,使 AI 能够直接操作本地文件和应用程序,提升非开发人员的使用效率。
AI工具正从生产力和能力扩展两个层面重塑产品经理工作流程。Claude、Notion AI和Grammarly等写作工具可快速起草PRD和总结研究,Dovetail和Perplexity能高效分析用户访谈反馈。Replit Agent 4使产品经理能在集成环境中直接将产品意图转化为可运行软件,突破传统开发流程限制。
Hamel Husain在PyAI Conf上发表题为《数据科学家的反击》的演讲,指出尽管LLM API让AI集成更便捷,但数据科学的核心工作——如实验设计、指标构建、数据验证和错误分析——并未消失。
StrongDM 公司的三人团队构建了一个完全由 AI 智能体编写、测试和部署生产软件的“软件工厂”,遵循“人类不编写代码”和“人类不审查代码”两条激进规则。该系统将人类制定的产品路线图转化为最终产品,每位工程师每天需消耗相当于其薪资的 AI token(至少 1000 美元)。人类仅对成品进行审查,而无需接触或查看底层代码。
技术专家可通过构建推动AI治理的工具,改变AI研发的底层动态。卫星遥感与连续排放监测等技术使气候治理成为可能,类似地,AI需发展可衡量性与低成本技术以实现可监管性。当前亟需开发模型行为基准、训练计算会计与评估标准,这些技术将使安全实践从被动合规转向经济可行的默认选项。
Ethan Mollick在宾夕法尼亚大学开设实验课,让学生在四天内用Claude Code、Google Antigravity、ChatGPT、Claude和Gemini等AI工具创建创业原型。
通过构建专门的超人类AI助手,可以实现对AI系统的超人类监督,这些助手只需在特定监督任务上超越人类,无需全面超越。利用AI系统生成的大量数据(如输入输出行为、神经元激活等),结合明确的可验证问题,可构建可扩展的奖励信号。
2025 年大语言模型领域持续发展,推理模型成为主流,DeepSeek R1 作为开源模型表现出与顶级闭源模型相当的性能,并引入 RLVR 和 GRPO 算法降低训练成本。训练 DeepSeek R1 的成本估计为 294,000 美元,远低于此前预期,但该数字仅涵盖计算资源费用,未包含研究人员薪资等其他成本。各大模型开发者均推出了基于推理的模型变体,推动了模型能力的扩展与优化。
AI 能力存在显著的“锯齿前沿”,即在某些任务上表现超人类而在其他任务上却表现不佳。例如,GPT-4.1 能在两天内完成相当于12人年工作量的医学综述,但在记忆和访问补充文件等任务上仍是短板。这种能力的不均衡性造成了自动化瓶颈,使得超级智能的 AI 目前仍难以完全替代人类。
Eugene Yan 回顾了 2025 年在技术写作、LLM 与 RecSys 融合应用及健康目标方面的进展。他发表了六篇实质性文章,包括关于改进推荐系统与搜索、训练 LLM-RecSys 混合模型等内容,并成功在 Kindle iOS 应用上线了 AI Reading Club(ARC)原型。此外,他坚持每周 5 公里跑步,数据显示其静息心率和 VO2 最大值有所提升。
Google 发布 Gemini 3.0 模型及配套智能体工具 Antigravity,作者实测其能自主构建交互游戏、分析旧数据并撰写学术论文,通过代码执行和多工具调用完成复杂任务,展现从聊天机器人向数字协作者的转变。
推荐理由:作者通过实测展示了 Gemini 3 在智能体能力、代码执行和自主研究方面的进展,读者可据此理解其作为数字协作者的潜力与边界。
本文通过模拟“面试”方式测试多个 AI 模型在不同任务中的表现,发现它们在处理特定场景时存在明显差异。Claude 4.5 Sonnet 在写作任务中表现突出,Gemini 2.5 Pro 在计数任务中出现误差,GPT-5 Thinking 风格多变但有时影响连贯性,而 Kimi K2 Thinking 也有类似问题。这种基于“氛围”的测试方式虽具主观性,但能揭示标准化基准难以捕捉的模型特性。
Sebastian Raschka 在文章中系统梳理了当前超越标准自回归 Transformer LLM 的多种架构方向,包括线性注意力混合模型(如 Qwen3-Next、Kimi Linear)、文本扩散模型、代码世界模型(CWM)和小递归变压器(如 TRM)。