管理作为AI超级能力:Ethan Mollick的实验课观察
Ethan Mollick在宾夕法尼亚大学开设实验课,让学生在四天内用Claude Code、Google Antigravity、ChatGPT、Claude和Gemini等AI工具创建创业原型。
Ethan Mollick在宾夕法尼亚大学开设实验课,让学生在四天内用Claude Code、Google Antigravity、ChatGPT、Claude和Gemini等AI工具创建创业原型。
2025 年大语言模型领域持续发展,推理模型成为主流,DeepSeek R1 作为开源模型表现出与顶级闭源模型相当的性能,并引入 RLVR 和 GRPO 算法降低训练成本。训练 DeepSeek R1 的成本估计为 294,000 美元,远低于此前预期,但该数字仅涵盖计算资源费用,未包含研究人员薪资等其他成本。各大模型开发者均推出了基于推理的模型变体,推动了模型能力的扩展与优化。
AI 能力存在显著的“锯齿前沿”,即在某些任务上表现超人类而在其他任务上却表现不佳。例如,GPT-4.1 能在两天内完成相当于12人年工作量的医学综述,但在记忆和访问补充文件等任务上仍是短板。这种能力的不均衡性造成了自动化瓶颈,使得超级智能的 AI 目前仍难以完全替代人类。
Google 发布 Gemini 3.0 模型及配套智能体工具 Antigravity,作者实测其能自主构建交互游戏、分析旧数据并撰写学术论文,通过代码执行和多工具调用完成复杂任务,展现从聊天机器人向数字协作者的转变。
推荐理由:作者通过实测展示了 Gemini 3 在智能体能力、代码执行和自主研究方面的进展,读者可据此理解其作为数字协作者的潜力与边界。
本文通过模拟“面试”方式测试多个 AI 模型在不同任务中的表现,发现它们在处理特定场景时存在明显差异。Claude 4.5 Sonnet 在写作任务中表现突出,Gemini 2.5 Pro 在计数任务中出现误差,GPT-5 Thinking 风格多变但有时影响连贯性,而 Kimi K2 Thinking 也有类似问题。这种基于“氛围”的测试方式虽具主观性,但能揭示标准化基准难以捕捉的模型特性。
Sebastian Raschka 在文章中系统梳理了当前超越标准自回归 Transformer LLM 的多种架构方向,包括线性注意力混合模型(如 Qwen3-Next、Kimi Linear)、文本扩散模型、代码世界模型(CWM)和小递归变压器(如 TRM)。
本文提供了一份关于当前如何正确使用 AI 的指南,建议根据实际需求选择免费或高级模型。Claude、Google 的 Gemini、OpenAI 的 ChatGPT 和 xAI 的 Grok 是目前最先进的四款 AI 系统,其中 Gemini 在免费图像生成方面表现最佳,而 Claude 缺乏图像和视频生成能力。