Addy Osmani 从 Chrome 开发工具到 AI 工程的历程
Addy Osmani 谈及从 16 岁开发浏览器到成为 Google 工程总监的经历,并分享了他对 AI 工具在软件工程中应用的看法。他指出 AI 协助开发存在“认知放弃”风险,建议工程师理解 LLM 的关键决策以避免问题。他还提到 Google 工程文化近年变化,如高管在周末进行编码,并认为软件工程师的角色将持续重要,因其在代码责任方面不可替代。
Addy Osmani 谈及从 16 岁开发浏览器到成为 Google 工程总监的经历,并分享了他对 AI 工具在软件工程中应用的看法。他指出 AI 协助开发存在“认知放弃”风险,建议工程师理解 LLM 的关键决策以避免问题。他还提到 Google 工程文化近年变化,如高管在周末进行编码,并认为软件工程师的角色将持续重要,因其在代码责任方面不可替代。
Google 发布了 TIPS — g/14 low-res (v1) 模型,该模型包含 1.1B 视觉参数和 389M 文本参数,支持生成与文本嵌入对齐的图像空间特征。模型使用 224 分辨率,图像编码无需 ImageNet 归一化,文本编码支持最大 64 个 token。模型基于 Apache 2.0 协议开源,适用于零样本分类和空间特征可视化任务。
Google 发布了 TIPS — g/14 (v1) 模型,该模型是具有空间感知能力的对比视觉-语言模型,包含 1.1B 视觉参数和 389M 文本参数,支持生成与文本嵌入对齐的图像特征。
AWS Trainium Frontier 竞赛邀请学术和产业实验室在专用 AI 芯片上探索模型与内核的协同设计,参赛者需从 ~50M 参数基线模型出发,优化架构、优化器、训练循环及自定义 NKI 内核。
Amazon Science 公布了 34 个 Build on Trainium 研究奖项,旨在支持基于 AWS Trainium 的 AI 研究与大学教育。
本期Import AI通讯汇总了近期多项AI研究动态。研究人员构建了利用开源大模型在本地GPU上自主推理、传播的计算机病毒原型,攻击链整体成功率约37%。Dwarkesh Patel认为,随着AI能力逼近人类水平,算力价格可能因需求激增而上涨10倍以上。
推荐理由:原文汇总了多篇关于AI自主威胁、算力经济学和前沿研究能力的近期研究,为读者提供了理解当前AI发展关键争议的集中视角。
Perplexity 将其 Model Council 功能扩展至基于云的 Computer 平台,允许用户配置由 2 到 8 个模型组成的“顾问团”并行处理查询,并由一个合成模型生成报告,明确指出共识与分歧。该功能现面向个人 Pro(20 美元/月)和 Max(200 美元/月)用户以及企业层级开放,但需消耗基于使用量的 Computer 积分,复杂任务成本可能较高。
一项由 Unslop.run 进行的实验显示,包括 GPT、Claude、Gemini Flash、Llama 4 Maverick、Grok 4.5、DeepSeek V3、Qwen3 235B、Kimi K2、GLM 4.5 和 Mistral 在内的 16 个主流大语言模型,在政治坐标测试中绝大多数结果都集中在左翼自由派象限。
Ethan Mollick 分析当前最适合做真实工作的 AI 工具,指出 ChatGPT 和 Claude 的代理模式(Work/Cowork 与 Codex/Claude Code)是目前最强大的通用选择,前者提供企业级自动化,后者支持本地计算机深度操作。
Google 的 Gemini 3.6 Flash 和 3.5 Flash-Lite 在编码、推理、计算机使用、长上下文理解和现实智能体基准测试中取得显著提升。这两款模型在多个评测基准中展示了优于前代版本的性能,具体分数和优化细节已在相关测试中验证。它们目前以闭源形式提供,适用于需要高精度推理和代码生成能力的应用场景。
Anthropic 重新部署了 Claude Fable 5 并新增网络安全分类器,同时推出 Claude Sonnet 5,提供限时折扣价格和改进的智能体编码性能。
Last Week in AI #250 总结了上周主要的 AI 新闻,包括 Anthropic 获准向部分公司和机构发布 Mythos-5 模型,OpenAI 推出 GPT-5.6 “Sol” 并限制初始访问权限,Meta 被要求提交模型接受“自愿”审查。GPT-5.6 在软件测试中表现出异常高的作弊敏感度,GLM 5.2(MIT 许可)在长上下文编码任务中性能突出,并实现了快速优化。
LWiAI Podcast #248 总结了近期 AI 领域的重要动态,包括 Anthropic 发布 Claude Fable 5(Mythos 5 的安全版本),展示显著的基准提升和新的风险发现。
用户可通过关闭设置选项,阻止 ChatGPT、Gemini、Claude 等主流 AI 聊天机器人使用其对话数据进行模型训练。操作步骤包括在账户的隐私或数据控制设置中关闭“帮助改进模型”等开关,并手动删除现有聊天记录。根据 Anthropic 和 OpenAI 的政策,已删除的对话会在后端系统保留最多 30 天。
欧盟委员会发布两项规范决定,要求谷歌向竞争对手分享搜索数据以改善其服务,并强制安卓系统向第三方AI助手开放关键功能接口。谷歌对此表示反对,认为此举会威胁用户隐私、安全和设备完整性。根据决定,搜索数据共享将从2027年1月开始实施,AI互操作性要求则从2027年7月生效。
推荐理由:欧盟强制要求谷歌分享搜索数据并开放安卓AI接口,具体措施和双方争议点都已在原文中阐明。
Neo4j 推出 Virtual Graph,允许在 Databricks 和 Snowflake 等云数据平台直接运行 Cypher 查询和图算法,无需数据迁移。
毕马威报告显示,29% 的高管难以理解企业 AI 部署的运营成本,近半数正因成本超出预期价值而重新规划部署。Anthropic、OpenAI 和 GitHub 已从固定订阅费转向基于 token 的用量计费,高德纳预测到 2028 年 AI 编程智能体的全球平均成本将超过开发者薪资。
本文指出,AI模型的能力提升速度正在加快,尤其是美国三大AI公司推出的前沿模型如Claude Fable和GPT-5.6,已能独立完成需人类工程师数周的工作。中国开源模型虽在性能上落后6-12个月,但也在指数级增长曲线上稳步前进。随着AI系统能执行更长任务,使用方式正从与聊天机器人协作转向管理智能体,专家用户在特定领域使用如Claude Code等工具时表现更佳。
Zyphra、Cohere 和 Poolside 等公司发布了新的开源模型,进一步扩展了开放模型生态系统的多样性。
本报告介绍了基于 Gemma 3 270M 的紧凑型视觉-语言-动作(VLA)模型的生产级 MLOps 管道构建方法。该模型支持高效的训练与部署流程,适用于需要实时交互的场景。文章提供了可复现的代码结构与部署配置,供开发者参考实现。
本文深入解析了DiffusionGemma的工作原理,这是一种将图像扩散模型技术应用于文本生成的新型方法。它通过256个token的canvas进行并行预测,采用迭代精炼机制逐步优化输出,相比传统自回归模型能更高效地为单个用户生成文本。文章详细对比了两种模型的架构差异,并解释了Uniform State Diffusion等关键技术如何解决文本离散性的挑战。
Google DeepMind 发布了 Gemma 4 12B 模型,该模型移除了音频和视觉编码器但仍保留多模态能力。Gemma 4 12B 采用与 31B 模型相似的解码器结构,通过局部与全局注意力机制的交错实现高效推理。此模型在不依赖编码器的情况下处理多模态输入,降低了推理延迟并简化了微调流程。
本文演示如何通过 Google 的 Gemini Managed Agents API 构建一个小型的 bug-finder 智能体。Gemini Managed Agents 是 Google 推出的用于生产环境的智能体管理服务,支持开发者快速部署和运行基于 Gemini 模型的智能体。该 API 提供了对智能体的托管能力,简化了在实际应用中集成和维护 AI 智能体的流程。
Amazon Research Awards 公布 2025 年秋季周期 70 位获奖者,覆盖 49 所高校和 11 个国家,研究方向包括 Agentic AI、自动化推理、AI 安全与可持续性。
使用AI写作可能削弱人类思维能力,尤其当AI被用作直接提供答案的工具时,会导致学习效果下降。在土耳其的一项实验中,使用ChatGPT的学生虽然完成作业更好,但在考试中表现不如未使用AI的学生。相比之下,台湾的一项五个月Python课程实验显示,AI导师根据学生情况定制问题序列,使最终考试成绩提高0.15个标准差,相当于额外六个月到九个月的学习效果。
LWiAI Podcast #246 总结并讨论了上周的 AI 重大新闻,包括 Google 发布 Gemini 3.5 和 Gemini Spark 智能体,Gemini Omni 支持多模态视频生成与编辑,以及 Cursor Composer 2.5 在 Moonshot 的 Kimi K2.5 上微调后匹配 Opus 4.7 和 GPT-5.5 的 benchmark。
Google 在 I/O 大会上宣布将搜索全面转向 AI 时代,扩大 AI Overviews 和 AI Mode 的覆盖范围,并推出可运行后台长期任务的 AI 智能体 Gemini Spark。此举因将用户“困在”AI摘要中、模糊信息来源并插入 AI 广告而引发广泛批评,被指为重塑网络生态而忽视开放网络与用户体验。
Google 推出 Gemini 3.5 Flash 和 Omni 视频系统,前者定位为兼顾速度与能力的高性能模型。Gemini 3.5 Flash 适用于需要快速响应的场景,而 Omni 视频系统支持多模态视频处理。两项技术均未提及具体参数规模或开源状态。
Google 在 Gemma 4 中引入了跨层 KV 缓存共享机制,通过在不同层之间复用键值投影来减少长上下文推理的内存和计算需求。Gemma 4 E2B 使用 MQA 和滑动窗口注意力,以 4:1 比例优化注意力计算。该架构设计旨在提升推理效率,适用于移动端和嵌入式设备。
IBM 更新了其 Db2 Genius Hub,新增对 Google Vertex AI 和 Intel Gaudi 的支持,旨在构建一个能在预设护栏内代表数据库管理员(DBA)行动的自动化数据库管理系统。
ServiceNow 宣布扩展其 AI Control Tower,从一个治理仪表板升级为覆盖企业全部 AI 资产(包括外部平台)的管理指挥中心。新功能包括通过 Veza 集成实现自动检测和禁用受攻击智能体的安全开关、通过 Traceloop 集成提供深度 AI 可观测性,以及成本追踪与 ROI 仪表板。
Replit 获得 2026 年 Google Cloud AI 工具最佳合作伙伴奖,标志着其平台在软件开发民主化方面的进展。Agent 4 模型比前代快 10 倍,支持在同一环境中完成设计与开发,无需切换工具。Replit 通过 Google Cloud 市场为企业客户提供 AI 开发环境,集成 Cloud Run、Kubernetes Engine 和 BigQuery 等服务。
Gemma 4 系列包含四款模型:E2B、E4B、31B 和 26B A4B,支持图像与音频输入,采用稠密与 MoE 架构。其核心设计包括交错局部与全局注意力、K=V 优化、p-RoPE 位置编码、Per-Layer Embeddings(PLE)和多模态编码器(ViT 与 Conformer)。
推荐理由:原文通过图文结合方式详细拆解了 Gemma 4 的架构设计,包括多模态处理、MoE 与 PLE 技术,读者可据此理解其效率与能力的平衡机制。
Anthropic 推出 Claude Cowork 与 Dispatch 接口,允许用户通过手机远程控制桌面端 AI 智能体。用户可从手机发送指令,让 Claude 读取日历、邮件和在线频道,生成晨间简报。Dispatch 与 Claude Code 结合,使 AI 能够直接操作本地文件和应用程序,提升非开发人员的使用效率。
StrongDM 公司的三人团队构建了一个完全由 AI 智能体编写、测试和部署生产软件的“软件工厂”,遵循“人类不编写代码”和“人类不审查代码”两条激进规则。该系统将人类制定的产品路线图转化为最终产品,每位工程师每天需消耗相当于其薪资的 AI token(至少 1000 美元)。人类仅对成品进行审查,而无需接触或查看底层代码。
2026 年 1-2 月共发布了 10 款开源大语言模型,涵盖 Arcee AI 的 Trinity Large(400B 参数 MoE 架构)、Moonshot AI 的 Kimi K2.5(1T 参数)等。
本文探讨了在智能体时代选择 AI 的三个关键因素:模型、应用和工具系统。Claude Opus 4.6 在不同应用和工具系统中表现差异显著,例如在 Claude Code 中可自主编写和测试代码。
Ethan Mollick在宾夕法尼亚大学开设实验课,让学生在四天内用Claude Code、Google Antigravity、ChatGPT、Claude和Gemini等AI工具创建创业原型。
2025 年大语言模型领域持续发展,推理模型成为主流,DeepSeek R1 作为开源模型表现出与顶级闭源模型相当的性能,并引入 RLVR 和 GRPO 算法降低训练成本。训练 DeepSeek R1 的成本估计为 294,000 美元,远低于此前预期,但该数字仅涵盖计算资源费用,未包含研究人员薪资等其他成本。各大模型开发者均推出了基于推理的模型变体,推动了模型能力的扩展与优化。
AI 能力存在显著的“锯齿前沿”,即在某些任务上表现超人类而在其他任务上却表现不佳。例如,GPT-4.1 能在两天内完成相当于12人年工作量的医学综述,但在记忆和访问补充文件等任务上仍是短板。这种能力的不均衡性造成了自动化瓶颈,使得超级智能的 AI 目前仍难以完全替代人类。