AI BUILDERS WEEKLY · 2026.08.23

AI Builders 周报 · 2026.08.23

本周焦点从模型能力转向 eval、agent 协议、权限治理与组织能否真正吸收 AI 红利。

统计周期 2026.08.17 — 2026.08.23 生成于 2026/08/23 19:00

本周最强共识是,AI 落地的瓶颈越来越不在模型本身,而在能否准确评估工作流、控制上下文与工具、管理权限,并持续优化成本和可靠性。通用 benchmark 只能描述模型能力轮廓,真正决定企业自动化速度的是贴近生产任务的专用 eval。

另一条主线是 agent 正从单轮对话工具迈向开放、异步的行动网络。MCP 一类标准协议需要与 agent 身份、授权和安全策略共同演进,而组织结构也必须改变,否则个人独立使用 AI 获得的巨大杠杆很难在大型公司内部兑现。

9Builders
19Tweets
0Blogs
1Podcasts
X / TWITTER

Builder 动态

01

Thibault Sottiaux:Codex rate limit 异常来自多个隐性消耗点

OpenAI 的 Thibault Sottiaux 披露,Codex 在长会话多次 compaction 后处理图片存在低效,Computer History 的高分位用量偏高,自动生成会话标题的功能也消耗了超出预期的额度。团队正在逐项修复并将重置所有付费订阅的使用量,同时还发现了一条与这些问题无关、可显著提升效率的新路径。

02

Peter Yang:用 coding agent 审计并撤销第三方数据权限

Peter Yang 演示了一种实用的隐私维护流程:在浏览器打开 Google 的第三方连接管理页面,让 Codex 或 Claude Code 检查现有授权,再选择不再需要的应用并由 agent 协助移除。他借此清理了大量仍能访问 Google 信息的旧应用,说明 browser agent 可以把复杂的权限审计变成可执行的日常维护任务。

03

Madhu Guru:优化 agent 前先建立失败模式与 eval 指南针

Meta AI 高管 Madhu Guru 将 eval 上的 hill climbing 概括为选择一个重要维度并持续优化,目标可以是关键用户旅程质量、新用例、成本或延迟。实际手段包括改进 harness、模型选择、prompt、context、memory、post-training 和确定性代码;例如工具调用频繁失败时,应按任务阶段只提供所需的三到五个工具,而不是一次塞入二十个。她建议先用最强模型把体验做到用户真正喜欢,再借 eval 逐步迁移到更小、更快、更便宜的模型。

04

Aaron Levie:企业 AI 扩散速度受限于专用 eval

Box CEO Aaron Levie 认为,模型发布时的通用 benchmark 很有价值,但只能显示整体进步形态和模型间相对能力。更大的机会是为企业主要工作流乃至单家公司建立专用 eval,因为无法评估进展的流程就无法可靠自动化,企业最终不能依赖主观感觉推进 agent 部署。

05

Zara Zhang:大型组织正在压低个人的 AI 杠杆

Builder Zara Zhang 观察到,有能力的人在独立项目中借助 AI 可能发挥十倍潜力,但进入大型组织后通常只能提升约百分之二十,有时甚至下降。她认为这正在推动更多人才离开大公司,少数顶级 AI 实验室可能是例外;问题的核心不是工具是否可用,而是组织流程、权限和协作成本是否允许个人快速行动。

PODCASTS

播客

01

AI & I by Every:Microsoft’s Vision for an Internet Made for Agents With CTO Kevin Scott (Best of the Pod)

核心结论是,模型推理能力已经领先于多数产品能够交付的体验,下一阶段的关键不是继续证明 scaling law,而是建立一张让 agent 真正采取行动的开放网络。Microsoft CTO Kevin Scott 认为,agent 要完成复杂委托,必须拥有持久 memory、工具访问和跨系统调用能力;MCP 可以扮演类似 HTTP 的连接协议,NLWeb 则可能承担类似 HTML 的表达层。Microsoft 内部希望所有系统通过标准协议与 agent 通信,避免每个团队都把组织结构和私有接口复制进自己的 agent。安全不能只靠封闭平台解决,开放协议还需要 agent identity、entitlement 和按任务申请权限的机制,让系统知道某个 agent 代表谁、可以访问什么。Scott 预计交互模式会从用户发 prompt 后等待回复,转向异步委托:agent 花较长时间调用多个系统、整合结果、反复迭代,最后把需要人类判断的部分交还用户。对于 coding craft,他不认为新工具会消灭选择,开发者仍会使用不同 agent;重要的是保持好奇,并根据自己重视过程还是结果来选择工具。真正有机会的创业公司也不必重建底层基础设施,而应凭借对具体问题更细致的理解,组合现有模型和工具,做出世界级解决方案。

ARCHIVE

历史周报