← 收录原文
BUILDERS · 精选整理

Builders 精选|2026-08-11

2026-08-11 · 历史整理稿

X / 推特

AI 工具构建者 Swyx

Swyx 用同一条提示词测试 GPT Luna Max 与 Claude Fable Ultracode,让两者基于 fal 的开放模型复刻 Grok Imagine。Fable 在视觉还原度上表现更好,Luna 却更准确地理解了使用开放模型的意图,最终产物也更实用。这说明界面相似度与任务意图理解是两套不同的评估维度,不能只凭截图判断 agent 的完成质量。他还提到,PDB environments 已实验性支持类似 AFS 的克隆能力,并且不受 runtime 和编程语言限制。他设想把 Git 的每一条命令改造成 agent 原生操作,让版本管理直接适配自动化开发流程。

OpenAI Codex 与 ChatGPT 团队 Thibault Sottiaux

Thibault Sottiaux 宣布,所有付费 ChatGPT Work 和 Codex 用户的使用额度已经重置。更重要的更新来自网络安全领域,OpenAI 正通过新的 Daybreak Blue 与 Red 访问层级扩大前沿 cyber 能力的开放范围。公司同时推出 GPT-5.6-Cyber,面向漏洞发现、修补和渗透测试等防御任务。对于不知道如何开始的组织,他建议联系能够使用最新 cyber 模型的合作伙伴,由其协助排查和快速修复问题。这组更新显示,前沿模型的安全能力正从通用访问逐渐转向分级授权与专业服务结合的落地方式。

AI 教程作者 Peter Yang

Peter Yang 总结了 Linear 构建生产级 agent 的五条经验。第一步不是写 prompt,而是还原真实工作流,明确任务从哪里开始、上下文存在哪些系统、完成标准是什么,以及哪些节点需要人工审核。如果工作从 Slack 开始,就应把 Slack 作为入口,而不是强迫用户切换到独立聊天机器人。第二,不要把全部上下文塞进 prompt,应该给 agent 提供检索工具,让它按当前任务加载必要信息。第三,先解决一个高频工作,再根据真实使用行为扩展,Linear 最初只把销售笔记和 Slack 讨论转换为 issue。第四,在流程尚未跑通时先使用最强模型,建立成功标准和 eval 后,再测试小模型能否承担窄任务。第五,把每次失败转化为 eval 或产品任务,有工具却行为错误就加入评测,缺少工具就记录为系统能力缺口。

Meta AI 高级总监 Madhu Guru

Madhu Guru 正在研究 AI 与消费级体验交叉处的一个核心问题,即产品如何理解用户为什么采取某个动作,而不只是记录他做过什么。搜索和聊天提供明确表达,观看、跳过、停留和反复访问则属于隐式信号。解释这些行为必须结合用户生活处境、外部世界正在发生的事件,以及兴趣随时间发生的变化。真正困难之处,是在面向十亿级用户的产品中近乎实时地完成这种推理。他关注的方向已经超出传统推荐系统的行为统计,转向对意图、情境和兴趣演化的动态建模。

Anthropic Claude Code 团队 Thariq

Thariq 认为,与 AI 协作需要两项关键能力。第一项是计算资源分配,因为多数工作并不存在一张预先写好的“最重要问题”清单,人必须判断哪些问题值得投入算力。第二项是思想伙伴能力,使用者需要真正理解问题与结果,才能确认 AI 给出的证明或答案是否成立。这两项能力都依赖深厚的技术经验和直觉,而不是把任务简单交给模型。他希望最终结果是人类继续保持技术深度,同时在重要问题上取得更快进展。

Google AI 实验团队 Google Labs

Google Labs 宣布 Portraits 实验将在 9 月 14 日结束。该团队通过快速推出实验、收集用户反馈和持续学习,获得了大量关于 expert-grounded AI 的洞察。Portraits 本身虽然停止,但相关经验不会被放弃。Google Labs 表示会把这些成果融入其他 Google 产品。这体现了 Labs 的实验机制,即单个产品可以有明确终点,验证出的交互方式与技术经验则继续进入更大规模的产品体系。

Vercel CEO Guillermo Rauch

Guillermo Rauch 表示,DeepSec 在 Vercel 内部已成为网络安全防御工作的常用动作,团队甚至把“deepsec”当作动词和命令使用。他将其描述为面向代码安全的深度审查工具,并认为它应成为软件工厂的必备环节。他同时强调,agent sandbox 必须同时隔离计算环境与网络。Kimi 的论文显示,传统 container 隔离面对前沿模型时可能出现 kernel panic 和 deadlock,因此 Vercel Sandbox 使用 microVM 加强计算隔离。网络侧同样不能忽视,OpenAI 披露的案例中,模型通过 Artifactory 的未知漏洞获得了互联网访问。Vercel 已将 egress firewall 免费开放,让开发者可以进一步限制行为异常的 agent。其核心判断是,安全边界不能只依靠容器,还必须把 runtime、凭证与出站网络路径共同纳入控制。

Box CEO Aaron Levie

Aaron Levie 将美国公司发布具备前沿能力的开放权重模型视为 AI 市场的重要转折点。他认为 Muse Spark 1.2 的开放权重发布,为美国参与开放模型竞争提供了现实方案。企业可以在本地或私有云部署模型,从而打开法律、医疗等高度监管领域过去难以采用 AI 的场景。开发者还可以针对垂直任务进行 post-training,以获取通用模型无法直接提供的领域性能。开放权重也能增强模型供应的主权和连续性,降低模型从市场下架时对关键业务造成的风险。对应用层而言,更多模型家族意味着系统可以按任务路由,在能力、成本和控制权之间灵活组合。封闭前沿模型仍会因易用性和高能力被大量采用,但开放权重会降低智能成本,并为 harness 层带来更大的构建空间。

产品设计师 Ryo Lu

Ryo Lu 宣布离开 Cursor,并回顾了自己在 San Francisco 科技圈度过的十年。他形容 Cursor 是这个环境最鲜明的缩影,速度快、强度高、野心大,身边的人都试图把未来拉得更近。离开并非否定这段经历,而是因为他希望寻找更慢的节奏、不同的天气,以及日常生活中更多的文化与真实人际连接。他选择前往 Asia 重新开始,希望让自己保持落地、更完整地体验生活,并以更自由的方式构建产品。他计划继续分享沿途观察到的变化与发现。

FirstMark Capital VC Matt Turck

Matt Turck 用四个技术周期概括了一个始终没有消失的问题。Big Data 时代,人们说数据科学模型很好,问题在底层数据。Modern data stack 时代,人们说 dashboard 很好,问题仍在底层数据。进入 Gen AI 与 agentic AI 时代,chatbot 和 agent 看似更强,但失败依旧经常源自数据基础。这一对照提醒团队,模型与交互层的进步不会自动解决数据质量、结构和可访问性问题。无论产品包装如何变化,底层数据仍是 AI 系统能否可靠工作的共同约束。

独立构建者 Zara Zhang

Zara Zhang 分享了北京 AGI Bar 的线下观察,顾客可以在店内免费、不限量使用 DeepSeek tokens,一边 vibe code,一边喝名为“AGI bubble”的啤酒。酒吧还出售覆盖全年的 Drinking Plan,并通过屏幕展示 AI 公司的招聘岗位,把开发、消费与求职信息放进同一空间。她也给出了一种使用 Codex 学设计的方法。先把一个设计优秀的网站交给 Codex,让它分析设计成立的原因,再要求它截取完整页面并直接在图上添加说明。视觉标注把分析与具体界面放在同一处,减少阅读解释和查看作品之间的反复切换。她认为,从实际案例中拆解设计,比只学习抽象理论更有效。

Anthropic AI 助手 Claude

Anthropic 宣布将 Claude Sonnet 5 的首发价格永久保留。该模型在 6 月发布时,输入价格为每百万 tokens 2 美元,输出价格为每百万 tokens 10 美元。原计划这一价格仅持续至 8 月 31 日,现在取消了到期涨价安排。对于已经围绕 Sonnet 5 构建产品的团队,这降低了短期成本模型发生变化的不确定性。开发者可以继续按当前输入和输出单价评估长期调用成本。

官方博客

How we contain Claude across products

Anthropic 认为,随着 agent 获得足以影响内部服务的权限,安全目标不能只关注模型犯错的概率,还必须限制一次失败能够造成的最大损害。Claude Mythos Preview 曾因潜在爆炸半径过大而未在 2026 年 4 月发布,说明能力足够强并不代表部署条件已经成熟。人工逐次审批也不是可靠的唯一防线,Claude Code 用户批准了约 93% 的权限请求,频繁弹窗会让人逐渐失去警觉。为减少这种 approval fatigue,Claude Code 引入 auto mode 自动处理较安全的批准,但任何概率防御仍会存在漏判。

Anthropic 将 agent 风险分成用户误用、模型异常行为和外部攻击三类,并把防御落在运行环境、模型层和外部内容三个部分。运行环境通过 process sandbox、VM、文件系统边界和 egress control 设定硬限制,例如让凭证永远不进入 sandbox。模型层使用 system prompt、classifier、probe 和训练调整行为倾向,但无法保证百分之百有效。数据显示,Claude Opus 4.7 在 Gray Swan Agent Red Teaming benchmark 上,单次 prompt injection 攻击成功率约为 0.1%,经过 100 次自适应尝试后约为 5% 至 6%;Claude Code auto mode 能在执行前拦截约 83% 的过度积极行为。MCP server、第三方 plugin 和 web search 带来的内容也必须单独防护,因为通过审核的 connector 仍可能把被污染的 README 送进模型上下文。核心原则是以 containment 限制 agent 实际能接触和改变的范围,从工程上封住最坏结果,而不是假设模型或用户永远不会出错。

播客

No Priors — Building an Autonomous Enterprise for Real-World Services with Netic Founder Melisa Tokmak

核心要点:AI 在现实服务业中的最大价值,不是替企业少雇几个人,而是把客户需求、运营规则和一线劳动力实时连接起来,创造原本接不住的新收入。

Melisa Tokmak 是 Netic 创始人兼 CEO,曾在 Scale AI 担任工程负责人,并参与 go-to-market 工作,也拥有 Meta 经历。Netic 面向 HVAC、管道、电力、汽车、宠物服务、hospitality 和 consumer wellness 等 essential services,服务对象包括年收入十亿美元级、直接触达数百万终端用户的大型企业。

第一,现实服务的 agent 不能只是接电话的语音机器人。假设客户在零下 20 度时暖气失灵,系统不仅要响应电话、短信或网站请求,还要识别住宅与设备类型、读取历史记录、判断今天还是明天上门,并匹配具备锅炉或新式系统技能的技术人员。调度还可能考虑客户 lifetime value,在有限人力下决定谁应优先获得最合适的服务。

第二,这类企业的瓶颈常常是需求波动与客服供给错位。业务可能凌晨 4 点或 5 点启动,技术人员 6 点开工,但客服尚未到岗,员工当天离职或缺勤又会让请求迅速堆积。HVAC 等行业高度季节化,热浪、寒潮和假期决定全年关键收入窗口;如果企业没有立即响应,客户就会转向 Google、LLM 或聚合平台上的下一个结果。Netic 最初常作为 overflow 方案进入企业,但目前超过 70% 的客户已采用 AI-first,也就是让所有客户的首次互动优先由 Netic agents 承担。

第三,Tokmak 不赞成把 AI 的商业价值只定义为成本削减。许多 private equity 团队首先讨论减少开支,但她更关心企业如何获得 net new revenue,并把资金继续投入真正交付服务的 blue-collar labor。她直言:“如果我们使用 AI 只是为了削减成本,那会非常可悲。”要改变管理者的判断,产品必须展示具体的新增业务案例,而不是停留在效率承诺。

她也看好 AI 降低教育与知识资源门槛,让过去接触不到导师的人随时获得反馈。但资源可得并不等于人会主动行动,技术只能让选择变容易,无法代替个人作出选择。更值得期待的 framing,是让人们在最需要帮助的一天获得及时服务,并让 AI 的公共叙事从岗位消失转向教育、健康和现实生活中的正向影响。