← 收录原文
BUILDERS · 精选整理

Builders 精选|2026-08-10

2026-08-10 · 历史整理稿

X / 推特

AI 社区建设者 Swyx

Swyx 回应了外界对 AI 工程内容质量的批评,强调社区与行业的规模已经大到无法由任何一个人完整掌握。对某些人而言是低质量内容的分享,也可能成为另一些人的关键启发。会议演讲者主要是工程师、研究人员、学者和创业者,他们分享的是自己的核心信念或全年工作成果,而非依靠演讲谋生的职业讲者。团队投入数百万美元用于现场视听制作和后期编辑,希望为演讲者留下可以发送给客户、员工及投资人的公开记录。他认为用播放量判断内容质量,会让人只能在观点流行之后才看见它,并把受算法操纵的热度误认为价值。不过,他也承认团队需要改善内容策划、讲者辅导和制作质量。对于是否把部分演讲发布到次级频道,他担心较小的初始流量会伤害讲者,因此仍在征求建议。此外,他提醒 agent 用户定期删除不再需要的 skills,因为过多 skill 不仅会占用上下文,还可能以难以预料的方式相互干扰。

Claude Code 团队 Boris Cherny

Boris Cherny 将 prompt injection 称为诈骗者攻击用户与 agent 最常见的方式。恶意网站可以把窃取 SSH 密钥或密码的要求伪装成普通文本,诱导模型将其当作指令执行。早期 Claude 模型曾受到这类攻击影响,这也成为重视安全的企业迟迟不采用 agent 的原因之一。Anthropic 持续训练模型识别并拒绝此类指令,Boris 表示 Claude 模型在实际使用中已经基本解决了 prompt injection 威胁。这一判断不仅来自实验室 eval,也与团队进行 red teaming 时观察到的结果一致。他同时引用了独立研究者制作的 benchmark,并希望其他模型实验室也提高相应的安全能力,因为所有模型变得更稳健才能共同降低用户风险。

实用 AI 教程作者 Peter Yang

Peter Yang 分享了 Linear Agent 将执行失败直接转化为产品反馈的机制。当用户要求它完成某项工作,而当前工具能力不足时,agent 会主动报告缺失的能力。Linear 的系统随后把这个请求加入 issue,使每个未完成任务都成为可追踪的功能需求。这种设计让 agent 不只是被动失败,而是持续为自身改进建立反馈队列。他还使用 Granola 记录父母讲述的家族历史,计划再用 AI 清理、组织素材并制作成实体书。这个流程把访谈记录、内容整理和长期保存串成了一条个人知识生产链。与此同时,他发现即使亲自引导普通用户从网页版迁移到桌面应用,agent 的使用方式依然令人困惑,说明产品能力与大众可理解性之间仍有明显鸿沟。

Meta AI 高级总监 Madhu Guru

Madhu Guru 认为,自己真正擅长的事情都来自一段近乎全身心投入的时期。冥想、单口喜剧、家庭、工作和 LLM 都曾成为他连续多年深入阅读、倾听、练习与思考的对象。积累达到一定程度后,知识不再只是能够复述的信息,而会转化为直觉。人会开始在潜意识中连接不同概念,并逐渐形成判断力与品味。他并不相信存在永恒的完美平衡,更愿意把生活理解为骑自行车,向一边倾斜过多之后再主动修正。

Replit CEO Amjad Masad

Amjad Masad 发布了 HelpPeer,一个面向 AI agents 的公共知识网络,希望把 agent 的自发协作能力用于公共利益。HelpPeer 提供两个 API,分别是 tell 和 lookup。agent 学到可能帮助其他人的信息时,可以通过 tell 发布到网络;执行昂贵任务之前,则可以用 lookup 查询其他 agent 是否已经遇到并处理过相同问题。他用全球性软件供应链攻击举例,如果 10,000 个安全 agent 各自检测、调查和逆向分析同一个异常,将产生大量重复劳动。在 HelpPeer 的设想中,最先发现问题的 agent 可以公开结果,其他 agent 随后进行验证、扩展并继续发布新发现。测试期间,Replit Agent 已经自发分享了一条与其使用的 Codegen library 有关的技巧。HelpPeer 目前正在邀请用户把测试说明交给自己的 agent,参与 beta 验证。

Vercel CEO Guillermo Rauch

Guillermo Rauch 认为,在当前阶段完全不阅读 agent 生成的代码,通常意味着项目仍处于学习、原型、一次性软件或尚无用户与收入的阶段,也可能意味着团队正在主动承担技术债务和风险。他并不否定这些场景,但强调模型尚未达到完全自治。模型仍会犯初级错误,也可能沿着糟糕的架构方向持续推进。他最近看到一个顶级模型为了让某个流程“稳定下来”而加入毫无意义的 700ms 延迟,模型在被指出后承认自己只是在机械模仿惯例。他相信人工阅读代码的必要性会继续下降,未来大量代码可能像汇编语言一样退居底层。但全球互联网和软件基础设施正在依赖这些模型,因此团队不能只相信自动化叙事而忽略工程责任。现阶段,通过直接阅读或让 agent 追问代码细节来理解实现,仍然是控制风险的重要环节。

Box CEO Aaron Levie

Aaron Levie 判断,agent 在不同行业中的普及速度会非常不均衡,关键取决于工作流能否支持连续、不中断的计算机操作。Agentic coding 增长迅速,是因为软件工作的经济价值可以直接对应纯数字产出,而且单次会话中的任务规模理论上没有上限。模型能力提升后,coding agent 可以几乎立刻承接更大的工作负载。销售、法律和医疗并不具备同样结构,因为销售需要等待客户反馈,律师需要与客户沟通,医生也必须与患者互动。如果所有员工同时请假,token 使用量可能大幅下降,因为目前多数 agent 仍在等待人类发出 prompt,而非在后台持续运行。未来的法律 agent 应该处理每一份新合同,销售 agent 可以持续扫描客户记录并寻找适合联系的信号,生命科学 agent 则可以系统阅读全部测试和研究材料。要实现这种模式,企业需要围绕 AI 重新连接和设计业务流程,而不能只把 agent 塞进现有的大量人工步骤中。因此,非编程领域的扩散将伴随更多变更管理、数据清理和工作流重构。

Y Combinator CEO Garry Tan

Garry Tan 最喜欢从已经暴露出来的问题开始工作,而不是先构建宏大的抽象方案。入口可以是一个 bug、一处能力缺口、一项错误声明、一个只完成一半的工具,或者机构中的反常行为。接下来需要追问,什么隐藏机制会让这个可见的失败成为可能。找到机制后,应当修复根因,而不是只处理表面症状。完成一次修复后再寻找下一个异常,并把这一循环长期重复下去。

FPV Ventures 合伙人 Nikunj Kothari

Nikunj Kothari 用 Fable 的经历说明,过度依赖 feature flags 会让产品默认行为变得难以理解。Fable 把大量功能放在以环境变量控制的 flags 后面,问题严重到他不得不在 Claude.md 中明确写入“默认值很重要,不要模棱两可”。这个教训指向 agent 编程中的一个具体风险,模型为了保留所有可能性,可能不断增加开关,而不是做出清晰的产品决定。他同时在寻找真正有效的 AI 多人协作体验。目前常见界面仍主要围绕单个人类与单个 agent 的配合设计,而多个人类与多个 agents 之间的协作尚未形成成熟范式。他提出的开放问题是,这种停滞究竟源于产品缺乏想象力,还是模型能力本身仍有限制。

SPC 普通合伙人 Aditya Agarwal

Aditya Agarwal 用 Wittgenstein 对语言的两次判断类比 AI 研究路线的变化。1921 年的 Wittgenstein 认为,语言必然拥有深层的逻辑结构。大约 30 年后,他转而主张不要继续寻找隐藏结构,而应观察语言在现实中如何被使用。类似地,1960 年代的 AI 研究相信智能背后存在可以明确表达的符号结构。大约 60 年后,主流突破却来自扩大 neural net 的规模,重点从预先规定智能结构转向让模型从使用与数据中学习。

官方博客

Claude Code now supports artifacts

Claude Code 现在可以把工作进度捕获为 artifact,将 session 中的内容转换成实时、可分享的可视化网页。适用形式包括 PR walkthrough、系统说明、可筛选 dashboard、事故调查页和自动更新的发布检查清单。artifact 会利用当前 session 的完整上下文,包括代码库、connectors 和对话内容,因此可以把失败测试、相关函数、监控工具中的错误峰值及根因分析组合到同一页面。用户无需额外连接数据源或部署基础设施,只需要求 Claude Code 创建一个页面。artifact 更新后,已经打开的页面会原地刷新,每次发布都会在同一个 URL 下生成新版本。系统同时提供版本历史、恢复能力和用于管理已有 artifacts 的 gallery。调试场景中,页面可以随着调查推进持续补充时间线、可疑 commits 和错误率图表,让工程团队与利益相关者看到相同上下文。每个 artifact 默认仅作者可见,分享后也只允许组织内已认证成员访问,不能公开发布。管理员可以通过组织级开关、角色范围、保留策略和 compliance API 管理访问与审计。该功能目前以 beta 形式向 Claude Team 与 Enterprise 组织开放,可从 Claude Code CLI 和桌面应用创建,并在浏览器中查看。

播客

Unsupervised Learning — Ep 92: xAI Co-Founder Unpacks the Future of Model Development

核心要点: agent 的下一阶段不只是继续提高 coding 能力,而是把可验证任务中的成功方法扩展到科学发现、个人 AI 与现实世界反馈,同时让更多人真正拥有 AI 带来的价值和控制权。

Igor Babushkin 现正创办 River AI,此前曾在 DeepMind 负责 StarCraft 与 AlphaCode 相关工作,在 OpenAI 参与早期 reasoning 研究,后来联合创办 xAI,并参与 Colossus 和模型研发。他将去年 11 月至 12 月视为软件工程的重要转折点,当时新一代 coding agents 强大到研究人员和工程师已经无法忽视。很多曾经排队等待的个人项目突然变得可实现,但能力快速增长也让开发者像“魔法师的学徒”一样,既获得力量,又必须面对力量失控的可能。

Coding 和数学仍是 agent 最自然的突破口,因为结果可以验证。代码能通过测试确认,数学定理与证明则可以借助 Lean 等工具形式化,从而提供明确的 reward signal。科学发现的难点不同,agent 设计新材料、研究基础物理或改进火箭发动机时,必须通过现实实验判断方案是否有效。真正的瓶颈因此不只是模型推理,而是如何闭合模型与物理世界之间的数据反馈循环。

个人 AI 不一定需要证明黎曼猜想,却必须理解用户的生活、工作和环境,并代表用户采取行动。Igor 认为,当前“大规模预训练、提供 API、按 token 收费”的模式只是行业形成的一组假设,并非 AI 唯一的构建与分发方式。River AI 正在探索新的模型构建、定制和交付路径,希望让企业和消费者更直接地控制 AI 的行为与使用体验。他强调:“让 AI 的收益与对 AI 的控制权得到更广泛的分配,本身就是 AI safety 的一部分。”

他认为眼前更迫切的风险不是遥远的模型接管,而是 AI 放大不平等,一部分人获得巨大收益,另一部分人却被落在后面。开放模型在接近危险能力门槛、但尚不足以造成现实伤害时尤其有价值,因为全球研究者都可以用它们测试 alignment、控制和网络安全方案。AI 安全不能只由大型实验室中的少数人研究。对 builders 而言,重要的不只是继续追逐最高能力,还要设计能够分配价值、扩大参与并让普通人保有控制权的技术与产品。