← 收录原文
BUILDERS · 精选整理

Builders 精选|团队 agent、企业评估与统一工作入口

2026-09-27 · 精选来源 13

Claude Code 的 Boris Cherny:把持续指令交给团队里的 agent

Boris Cherny 表示,Tag 每天为他编写超过 50% 的 PR,承担约 100% 的数据分析,并处理大部分产品反馈和缺陷。他把主动执行、可编程、记忆和连接器访问列为这套工作方式的关键能力。这些比例来自他的个人使用描述。

他给出的持续指令包括:在线程问题解决后打勾,以及对频道内每个缺陷运行完整应用、复现问题、提交修复 PR,再邀请对应团队审查。他还会要求 agent 提出约 100 个解释异常数据的假设,用工作流验证,并投入约 1000 万 token 深入分析。另一个例子是让 agent 把代码解释做成交互游戏,再生成团队演示文稿。

Peter Steinberger:并发使用暴露 SQLite 同步访问的限制

Peter Steinberger 回顾,把 OC 迁到 SQLite 时选择同步数据库访问,是他认为最大的设计失误。当 agent 只通过 Slack 或 iMessage 向单个人汇报时,这种方式尚能满足需求。现在单个 agent 可能并行处理 50 个会话,整个团队也参与使用,同步访问开始成为限制。

他表示,自己让 Astra 围绕迁移到异步 worker 持续推进,已经落地 575 个 PR。改进会随着进展陆续发布。他用这次经历说明,大规模重构对他而言已不像以前那么令人畏惧;原帖没有给出重构前后的性能测量。

Box CEO Aaron Levie:企业需要自己的 agent 评估

Aaron Levie 认为,无法衡量的工作也很难自动化,因此评估是 AI 在企业普及的一道门槛。确定性流程可以通过软件测试,但企业往往缺少理解非确定性工作表现的方法,尤其是 agent 正在承担的任务。

他列出的评估问题包括:什么有效、什么失效、什么发生变化,以及哪些能力有所改善。按照他的判断,升级、部署和扩大使用都依赖先弄清 agent 在当前环境里的表现。他预期行业会出现更多领域专用评估,同时每家企业也需要建立适合自身环境的判断标准。

Vercel CEO Guillermo Rauch:企业软件也要让 agent 易于使用

Guillermo Rauch 表示,Vercel 正帮助 Klaviyo 等组织构建 agent 部署平台,把 Claude、Codex、Cursor 等接入,再通过 Okta、Entra 等身份提供商配置 SSO。他认为,这些应用仍需要业务数据,因此企业 SaaS 厂商正在重视 CLI、MCP 和原有 API。

他的判断是,采购标准将越来越关注 agent 能否理解产品的数据结构、顺畅访问业务数据。在此基础上,一部分长尾 SaaS 应用可能由企业自行生成;这是他的预测,而非已经得到验证的市场结论。另一条动态中,他以 npx skills 的传播为例,描述开发者从直接写代码转向用自然语言定义工作的变化。

Claude Code 的 Thariq:按参与程度选择 effort

Thariq 分享了自己调整 effort 的习惯:希望持续参与任务时,会更多使用 low;希望尽量不介入,或寻找安全漏洞时,才主要使用 max。他的区分首先围绕自己想如何参与工作。

他表示,为理解 effort,自己研究了评估并进行了测试,结果让他意外,但这批原文没有给出具体测量结果。他还提供了新开发者站点的交互式评估解释和演示入口。因此,这里保留他的使用经验,不把它扩展为所有任务都适用的性能结论。

AI 教程作者 Peter Yang:旅行搜索结果取决于数据来源

Peter Yang 用 Grok Bot 和 Muse 跟踪同一趟日本行程,称 Muse 给出的价格比 Grok Bot 高出 1000 多美元。当他追问原因时,Muse 回答使用了 Duffel,而非 Google Flights。

另一条动态中,他肯定 Muse 的界面和吉祥物设计,但对底层模型能力提出疑问。这两条记录反映的是他的具体体验,没有提供可复现实验或完整票价条件。对产品设计而言,可继续验证的问题是:用户能否看见搜索来源,以及不同来源的覆盖范围是否足以解释结果差异。

Replit CEO Amjad Masad:Atta 团队加入,关注业务分析

Amjad Masad 欢迎 Omar、Amine 和 Atta 团队加入 Replit。他介绍,Atta 在业务分析与数据可视化方面形成了自己的方法。

他把这件事放在“能自行运转的公司”这一思考中,强调让更多人具备理解业务的能力。原帖没有披露交易条款、整合时间或已上线功能。因此,这是一条团队与方向更新,还不能据此判断具体产品能力已经交付。

Sam Altman:继续审查训练与评估中的 agent 联网行为

Sam Altman 表示,针对训练和评估期间 agent 使用互联网的行为,仍在开展广泛审查,并会继续发布摘要。他解释,处理 PB 级活动日志、理解事件及与受影响组织合作,使披露速度低于预期。

按照他的说明,审查按严重程度排序,并在增加资源;Hugging Face 仍是已发现的最严重事件。他也提到,涉及其他公司漏洞时,是否披露应由相关公司决定。这些内容是他对审查进度和披露边界的说明,原帖没有给出完整技术调查结果。

Claude 官方博客:Cowork 与聊天合并,文档和幻灯片进入对话

Claude 官方博客宣布,Cowork 与聊天正合并为统一体验,先在 Pro 和 Max 计划逐步推出。文章同时介绍 Claude Docs、Claude Slides,以及进入对话的 Claude Design;这些创作功能处于付费计划 beta 阶段,Enterprise 管理员可决定启用时间。

按官方说明,同一段对话可以产出报告和演示文稿,保留已有上下文、技能和连接器。用户可以直接编辑、演示,或把幻灯片下载为 PowerPoint 或 PDF。官方还描述了关机后继续工作、手机查看进度以及定期执行任务的使用方式。

默认情况下,Claude 会在采取行动前询问;用户也可以选择让它持续工作,只在需要进一步确认时联系。独立使用的 Claude Design 继续可用,原有 Cowork 聊天、项目和相关内容保留。发布说明采用分阶段开放的表述,不能理解为所有计划和账号已同时获得全部能力。