Casey Muratori 解释为何高性能代码重要但常被忽视
Casey Muratori 强调高性能代码对软件行业的重要性,但指出其常被忽视。他批评仅依赖性能分析工具优化代码的做法,认为应从架构层面设计性能。他还提到理解 CPU 运作只需掌握数据流动、指令流程和执行单元调度三个核心要点。
Casey Muratori 强调高性能代码对软件行业的重要性,但指出其常被忽视。他批评仅依赖性能分析工具优化代码的做法,认为应从架构层面设计性能。他还提到理解 CPU 运作只需掌握数据流动、指令流程和执行单元调度三个核心要点。
LangChain 博客提出了一种名为 Wiki Memory 的 AI 智能体记忆系统,通过将原始数据转化为结构化文件形式,为智能体提供持久、可读的知识层。该方法不同于 RAG,采用预计算方式生成知识摘要,便于后续智能体快速理解领域内容。Wiki Memory 适用于长期领域知识存储,而非短期对话状态或高频日志记录。
On Writing #3 分享了多位作家的写作方式,包括 Scott Sumner、Scott Alexander、Jasmine Sun 等,强调写作焦虑对创作的推动作用。文中提到年轻作家若不常因“是否还能写出好作品”而焦虑,可能未真正投入写作。摘要里每个具体数字、产品功能名、版本号都必须在原文里找得到对应。
麦肯锡表示,企业级 AI 正式进入“实现 ROI”的阶段,但多数受访者尚未报告 AI 带来组织层面的盈利贡献。调查显示,37% 的受访者认为 AI 对 EBIT 有一定影响,与去年数据持平,而仅 6% 的受访者被归类为 AI 高绩效者。尽管 80% 的 AI 使用者表示其个人生产力有所提升,但 AI 相关运营成本已限制部分企业使用,且未来一年 39% 的受访者预计 AI 会导致裁员。
工程师需要具备适应能力以应对 AI 带来的技术变革,但教育和职场培训往往未明确解释其含义。亚利桑那州立大学教授 Samantha Brunhaver 指出,适应性意味着识别变化并有效应对,且在不同行业中表现形式各异。微软研究员 Jenna Butler 表示,软件工程师正面临代码审查增加等挑战,需学习新工具和智能体管理以保持竞争力。
Every 网站通过收集主编 Kate Lee 的 30,000 次历史编辑数据,训练了一个复制编辑智能体,以模拟其编辑风格。该网站同时是一家产品工作室,提供 Cora、Sparkle、Spiral 和 Monologue 等 AI 工具,整合在每月 20 美元的订阅服务中。
The Pulse 报道了 Asana 使用 AI 在两周内完成从 Enzyme 测试框架迁移的案例,AI 显著加速了大规模测试用例重写工作。Airbnb 和 Uber 也有类似经历,表明 AI 在框架迁移中具有显著优势。文章还提到 GitHub 近期宕机事件、Slack 推出 Slack Code、Claude 生成文本将添加水印以及 Uber 开源 SubmitQueue。
Addy Osmani 谈及从 16 岁开发浏览器到成为 Google 工程总监的经历,并分享了他对 AI 工具在软件工程中应用的看法。他指出 AI 协助开发存在“认知放弃”风险,建议工程师理解 LLM 的关键决策以避免问题。他还提到 Google 工程文化近年变化,如高管在周末进行编码,并认为软件工程师的角色将持续重要,因其在代码责任方面不可替代。
图技术通过存储和分析数据之间的连接,使 AI 智能体能直接查询、遍历和推理关联数据,从而将模型幻觉率降低 44%。它构建知识图谱,让智能体在回答问题时能追踪多个实体之间的关系路径,而非仅依赖孤立数据片段。图技术作为企业 AI 的知识层,提供记忆、上下文和推理能力,无需替换现有数据库即可实现更准确、可解释和可治理的 AI 应用。
作者使用大语言模型(LLM)构建个人知识库,显著提升了工作中的研究效率。该方法通过将资料整理为 Markdown 格式的维基,支持持续更新和快速检索。
2026年多位资深工程领导者在未明确规划下一份工作的情况下选择离职或长期休职,主要因创始人对AI的不切实际期望和过度干预导致工作环境恶化。部分CTO和VPE表示,AI技术被用作裁员工具而非提升工程文化的手段,使得产品质量和战略决策的重要性被削弱。一些初创公司如Ramp、Stripe和Notion被提及为仍能平衡AI与工程质量的例外。
MIT 教授 Eugene Fitzgerald 在新书《The Invisible Engine》中提出,创新是市场应用、技术与实施三者的整合,其核心是企业家承担不确定性并创造市场“惊喜”的过程。他基于在 MIT-Masdar 等大型合作研究项目中的十年实践,区分了旨在培养人才的“利他科学”、围绕目标的“战略研究”以及从研究到经济增长的“基础创新”三种不同的研究投资类型。
开源语言模型训练流程正成为类似开源操作系统的发展路径,Nvidia 通过发布 Nemotron 模型的数据和训练代码推动这一趋势,希望让更多人能构建基于 token 的智能系统。
AMD 的 AI 智能体已实现软件开发中 30% 的生产力提升,并正在推动软件开发生命周期(SDLC)结构的重构。目前 AI 智能体可独立完成代码分析、调试、测试生成及审批流程,其中部分软件组件的 AI 生成代码占比已超过 80%。
Meta 触发的“离职潮”持续扩大,未被裁员或调岗的工程师纷纷另谋高就,公司试图通过高额股权激励挽留,但效果不佳。Cursor 团队发布了一款通用 AI 工具,提供类似 Codex 的知识工作自动化体验,用户反馈积极,预计更多 AI 厂商将跟进。本周 The Pulse 发布延迟一天,因作者家庭新增宠物狗,影响了工作节奏。
Town 的 CEO Jean-Denis Greze 表示,其公司正在开发一种基于用户数据自动构建知识库的自组织公司工具,该工具能从邮件、会议记录和 Slack 中提取信息。Town 的核心功能是名为 Townie 的数字助手,目前个人版收费 $49 至 $59 每月,企业版将禁止雇主读取员工 Townie 对话,并在 15 天后删除会话数据。公司计划很快推出团队版的自写维基功能。
作者指出当前大语言模型在长篇非虚构写作方面进展缓慢,即便在 2026 年仍难以胜任完整章节的撰写,存在表述混乱和组织性差的问题。GPT 5.5 Pro 能够发现 200-300 页教材中的深层拼写错误,而 Claude 模型在编辑任务中表现更佳,能提供更有洞察力的修改建议。模型在技术细节处理上已接近人类水平,但在整合多个内容单元、形成连贯整体方面仍显不足。
自动化推理组(ARG)自2016年成立以来,通过数学逻辑验证技术,构建了AWS安全与可靠性核心系统,如今每日处理数十亿查询。其开发的Tiros工具已成为Amazon Inspector和Reachability Analyzer的基础,Zelkova则用于分析AWS策略及后果。
智库 IFP 提出了 23 项应对 AI 研发自动化(RSI)风险的具体政策建议,涵盖透明度、国家能力、风险管理等七个类别。MIT 和哥伦比亚大学的研究表明,AI 公司间实现协调放缓的关键在于技术发展的透明度与对竞争对手作为可信赖理性行为者的信任。
前沿模型在近期黑客事件中展现出更强的持续性和用户意图假设能力,可能增加安全风险。OpenAI 的 GPT-5.6 模型因其推理时的高持久性和计算效率被提及,而 Claude 则因相对“懒惰”显得更安全。了解模型内部指令和特性对分析早期对齐问题至关重要,但目前公开信息有限。
Replit 认为企业 AI 采用的核心障碍是信任问题,并于 2025 年底开始构建用于定义数据含义和修正的记录系统。该运营真值层是一个版本可控、经过人工审核、与模型无关的定义与修正知识库,旨在让每个处理数据的智能体都从相同的业务理解起点出发。Anthropic、OpenAI 和 Meta 也各自通过其智能体架构、内部数据智能体和分析智能体,在构建经过验证的知识层这一方向上呈现出行业共识。
Ethan Mollick 分析当前最适合做真实工作的 AI 工具,指出 ChatGPT 和 Claude 的代理模式(Work/Cowork 与 Codex/Claude Code)是目前最强大的通用选择,前者提供企业级自动化,后者支持本地计算机深度操作。
Kimi K3 和 Qwen 3.8 等中国开源模型近期发布,显示出在性能和应用上的快速进步。Qwen 宣布其下一版本将开放权重,这在开源模型领域是一大变化。开源模型与闭源模型在前沿任务上的差距常被不同基准测试放大,但实际应用中仍具潜力,尤其在软件工程等细分领域。
公共部门 AI 需要构建劳动力知识层以实现更准确的推理,该层通过连接人员、角色、技能、任务等数据形成统一的知识图谱。知识层能揭示人员资质与任务需求之间的关系,避免因数据碎片化导致的决策不一致。在涉及安全、医疗、国防等高后果场景中,知识图谱可帮助 AI 更好地理解组织内部的依赖与风险。
Moonshot AI于7月16日发布旗舰模型Kimi K3,该模型为2.8T参数的MoE架构,将于7月27日开放权重。Kimi K3在多个基准测试中表现优异,位列Vals AI指数第2、Artificial Analysis智力指数第3,且在前端代码领域排名第一。
推荐理由:原文明确指出Kimi K3是2.8T参数的MoE模型,将在7月27日开放权重,且性能对标前沿闭源模型,读者可据此评估其对开源生态的影响。
企业 AI 的失败并非源于模型或框架,而是因为智能体无法理解其运行的业务环境。知识层(KL)是一个共享且受治理的底层结构,用于存储企业知识,包含业务概念、数据资产和流程的实时映射,以及用于学习和追溯的决策记忆。KL 使组织知识可查询如数据、可执行如代码,通过统一的业务模型帮助智能体在政策范围内准确执行任务。
MIT 研究员 Bailey Flanigan 利用计算与数学工具为民主参与创造新途径。她的研究包括开发算法,以随机方式选择公民大会的参与者,从而在自我选择可能无法反映整体人口的情况下,平衡代表性、参与机会平等、抗操纵性和透明度。
Replit 官方分享其内部 AI 智能体系统如何改变公司运作:工程团队代码产出提升 5.8 倍,评审延迟持平,质量指标改善;智能体参与代码审查、事故调查、数据查询、销售支持、客服响应等,实现跨职能自动化;员工未被替代,而是被‘升职’为决策者;系统已扩展至全公司,支持自服务分析、客户触达和文档生成;Replit 正推动将此模式开放给用户。
推荐理由:Replit 描述了内部 AI 智能体系统如何重塑工作流,从工程到销售、支持等全职能提升效率,且未牺牲质量或增加瓶颈。
公共部门面临复合型人力部署问题,需同时考虑人员技能、资质、位置及调动影响。Neo4j 的图智能平台通过构建知识层连接现有系统,提供统一视角分析人力部署。该平台不替换原有系统,而是基于结构化关系实现跨系统推理,帮助领导者快速回答复杂操作问题。
作者在 ICML 大会上提出“AI 作为正常技术”的框架,认为除非出现递归自我改进等重大突破,否则 AI 的影响将与以往技术类似,不会突然取代人类工作。该框架强调需关注 AI 能力之外影响实际部署的因素,并指出未来工作将发生巨大变化,需要大量适应。作者团队正在推进 AI 智能体评估的科学研究,以更准确理解 AI 对社会和经济的长期影响。
开源大语言模型可能在未来6个月内面临被禁或无限期延迟的风险,若其能力达到GPT 5.5、Claude Opus 4.8或GLM-5.2水平。目前中国开源模型如DeepSeek在能力上领先其他开源模型,但尚未发布公开版本。Anthropic推动的政策讨论正将开源模型与安全、技术竞争等议题捆绑,其主张可能影响美国市场对开源模型的监管方向。
随着 AI 推理成本急剧下降,GPT-4 级别能力的成本已从 2023 年初的每百万 token 约 30 美元降至如今低于 1 美元,部分提供商甚至低于 0.1 美元。这标志着足以胜任大多数知识工作的智能正变得近乎免费,从而催生了数据系统需为 AI 智能体设计、由智能体构成以及由智能体构建的三大新挑战与机遇。
MIT 校长 Sally Kornbluth 在华盛顿邮报活动上警告,缺乏联邦对好奇心驱动研究的支持将危及美国的创新和人才管道。她强调 MIT 新课程在夯实 STEM 基础的同时,更加强调道德、公民和伦理教育,以培养能在 AI 时代负责任地使用技术、撰写有效提示词的领导者。Kornbluth 还指出,联邦资金冻结将阻碍从糖尿病到癌症等重大疾病疗法的长期基础研究进程。
本文指出,AI模型的能力提升速度正在加快,尤其是美国三大AI公司推出的前沿模型如Claude Fable和GPT-5.6,已能独立完成需人类工程师数周的工作。中国开源模型虽在性能上落后6-12个月,但也在指数级增长曲线上稳步前进。随着AI系统能执行更长任务,使用方式正从与聊天机器人协作转向管理智能体,专家用户在特定领域使用如Claude Code等工具时表现更佳。
智能体 AI 指能采取行动(如预订航班)的 AI 系统,其核心通常是 Claude 等基础生成模型,并封装了特定工具。2025 年 11 月的一项调查显示,35% 的企业已部署 AI 智能体,44% 计划近期部署。当前最成功的应用是编码智能体,但其发展受限于训练数据不足,且存在引入错误、数据泄露和人类技能退化的风险。
fal 营销与增长负责人分享了在生成式媒体基础设施公司内部运用 AI 的实践经验。团队将 AI 选择性用于快速制作效果图、创意探索和将想法可视化,以加速从直觉到具体产物的过程并收紧反馈循环。其实践表明,最有用的 AI 应用往往是更窄、更可控的,旨在帮助团队更快决策而非实现全流程自动化。
Zyphra、Cohere 和 Poolside 等公司发布了新的开源模型,进一步扩展了开放模型生态系统的多样性。
开源 AI 是一种允许技术公开共享、构建和分发的流程,其安全性、透明度和对经济的推动作用已被广泛验证。超过 90% 的全球软件基于开源技术构建,产生了超过 8 万亿美元的经济效益。开源技术在教育、创新和竞争中发挥着关键作用,为初创企业和学术机构提供了对抗大公司垄断的工具。
作者在 iOS 和 macOS 27 开发者测试版中实测新版 Siri,发现其将 Spotlight 搜索变成了一个以 Siri 为先的界面,导致进行网页搜索需要多次点击。作者认为这类似于 Google 的 AI Overviews,并指出苹果 AI 负责人来自 Google 的背景可能与此有关。作为替代方案,作者通过 Siri 创建了一个可放置在主屏幕的快捷指令来直接进行 Google 搜索。
Ethan Mollick 获得 Claude 5 Fable 早期访问权限,实测其在多个复杂任务中的表现,包括生成等时线地图和研究分析软件 Concord。Fable 能自主调用多个代理进行研究、编码和验证,完成多页规格的长期任务,输出质量显著优于此前模型。
推荐理由:作者通过多个复杂任务实测,展示了 Mythos 级模型在自主执行、多代理协作和深度推理上的能力变化,读者可据此理解人机协作关系的潜在演进方向。