Andrej Karpathy:从一次性图像测试走向按需生成完整世界
Karpathy 给 Opus 5 一段《指环王》开头、约 100 万 token 预算和两小时执行时间,模型写出约 5,500 行 three.js 代码来程序化还原故事。他认为,LLM 的耐力让过去不值得人工定制的世界变得近乎免费,但模型仍缺乏高效观看视频、进入游戏并审查自身作品的能力。
定制世界、垂直能力爆发、agent 安全边界,以及 AI 如何进入真实服务业。
本周最明显的共同信号,是 AI 正从通用聊天能力转向能够长时间执行、生成完整世界并深入专业流程的系统。与此同时,真正限制部署速度的已经不只是模型能力,而是验证、工作流接入和安全边界。
开发者工具正在向 agent 原生形态重构:从容忍机器生成代码的新语言,到由云端 coding agent 接管开源 Issue,再到可以自托管的 agentic CRM。真实企业侧则更关心可验证收入,而不只是降本演示。
Karpathy 给 Opus 5 一段《指环王》开头、约 100 万 token 预算和两小时执行时间,模型写出约 5,500 行 three.js 代码来程序化还原故事。他认为,LLM 的耐力让过去不值得人工定制的世界变得近乎免费,但模型仍缺乏高效观看视频、进入游戏并审查自身作品的能力。
Swyx 关注从运行机制出发重新设计编程语言的尝试。他的判断是,在 agent 大量生成代码的环境里,系统对不完美代码具备容错能力,比单纯抵制所谓 AI slop 更有价值。
Rauch 推荐一种建立在 Next.js 之上的开源 agentic CRM:模型无关、可自托管或 serverless 部署,同时支持多渠道和 headless 使用。他把这组能力视为 agent 产品更合理的基础形态。
Levie 判断,消费和日常生产力场景会逐渐接近需求上限,但数学、科研、法律和编程等专业领域没有类似天花板。短期问题反而是能力过剩:模型进展必须接入真实数据集和工作流,才能转化为生命科学、自动化和网络安全等领域的突破。
Garry Tan 观察到 2026 年一个明显变化:OpenAI 更像在提供可调用的基础智能,而不是要求开发者一路采用同一套全栈产品。他把这一区别概括为“智能公用能力”与“全栈垂直整合”之间的路线分化。
Zara Zhang 把 agency 视为最重要的人类品质:环境会试图给人分类、贴标签并限定边界,而个体需要持续保留主动选择与行动的能力。
Kothari 指出一个反差:模型已经能处理 NP-hard 问题,传统企业却仍在争论 token 投入的 ROI。他认为未来几十年的主要工作,是把现有模型能力扩散进真实组织和流程。
Shipper 提出的判断与“AI 直接减少工作量”的直觉相反:当 AI 扩大产出和探索空间后,验证、判断和承担责任仍需要专家,因此专家工作可能随之增加。
Anthropic 将 agent 风险拆成用户误用、模型误行为和外部攻击,并把防线分为模型、运行环境和外部内容三层。其遥测显示用户会批准约 93% 的权限提示,说明频繁弹窗会造成审批疲劳;更可靠的基础是 sandbox、VM、文件系统边界和网络出口控制。文章还披露 Claude Code 自动模式可拦截约 83% 的过度主动行为,但强调概率性模型防线不能替代确定性的环境隔离。核心原则是:“The deterministic boundary is what gets hit when everything probabilistic misses.”
核心结论:真实服务业采用 AI 的关键不是炫目的 demo,而是把客户上下文、沟通、分析和派工连接成持续产生收入的系统。Netic 创始人 Melisa Tokmak 希望除现场人工服务外,其余企业流程都能由同一智能层自治处理;她称平台经 AI 处理的互动已为客户创造超过 6 亿美元收入。她同时强调长期主义和 craftsmanship:“Building really good things take a very long time.” 对私募股权客户,AI 的价值叙事也应从单纯削减成本转向创造新增收入。