X / 推特
AI 社区建设者 Swyx
Swyx 回应了外界对 AI 工程内容质量的批评,强调社区与行业的规模已经大到无法由任何一个人完整掌握。对某些人而言是低质量内容的分享,也可能成为另一些人的关键启发。会议演讲者主要是工程师、研究人员、学者和创业者,他们分享的是自己的核心信念或全年工作成果,而非依靠演讲谋生的职业讲者。团队投入数百万美元用于现场视听制作和后期编辑,希望为演讲者留下可以发送给客户、员工及投资人的公开记录。他认为用播放量判断内容质量,会让人只能在观点流行之后才看见它,并把受算法操纵的热度误认为价值。不过,他也承认团队需要改善内容策划、讲者辅导和制作质量。对于是否把部分演讲发布到次级频道,他担心较小的初始流量会伤害讲者,因此仍在征求建议。此外,他提醒 agent 用户定期删除不再需要的 skills,因为过多 skill 不仅会占用上下文,还可能以难以预料的方式相互干扰。
https://x.com/swyx/status/2086700857358450853
https://x.com/swyx/status/2086505938144616810
Claude Code 团队 Boris Cherny
Boris Cherny 将 prompt injection 称为诈骗者攻击用户与 agent 最常见的方式。恶意网站可以把窃取 SSH 密钥或密码的要求伪装成普通文本,诱导模型将其当作指令执行。早期 Claude 模型曾受到这类攻击影响,这也成为重视安全的企业迟迟不采用 agent 的原因之一。Anthropic 持续训练模型识别并拒绝此类指令,Boris 表示 Claude 模型在实际使用中已经基本解决了 prompt injection 威胁。这一判断不仅来自实验室 eval,也与团队进行 red teaming 时观察到的结果一致。他同时引用了独立研究者制作的 benchmark,并希望其他模型实验室也提高相应的安全能力,因为所有模型变得更稳健才能共同降低用户风险。
https://x.com/bcherny/status/2086520950259118464
实用 AI 教程作者 Peter Yang
Peter Yang 分享了 Linear Agent 将执行失败直接转化为产品反馈的机制。当用户要求它完成某项工作,而当前工具能力不足时,agent 会主动报告缺失的能力。Linear 的系统随后把这个请求加入 issue,使每个未完成任务都成为可追踪的功能需求。这种设计让 agent 不只是被动失败,而是持续为自身改进建立反馈队列。他还使用 Granola 记录父母讲述的家族历史,计划再用 AI 清理、组织素材并制作成实体书。这个流程把访谈记录、内容整理和长期保存串成了一条个人知识生产链。与此同时,他发现即使亲自引导普通用户从网页版迁移到桌面应用,agent 的使用方式依然令人困惑,说明产品能力与大众可理解性之间仍有明显鸿沟。
https://x.com/petergyang/status/2086562291206791482
https://x.com/petergyang/status/2086660536528420998
https://x.com/petergyang/status/2086496705609085350
Meta AI 高级总监 Madhu Guru
Madhu Guru 认为,自己真正擅长的事情都来自一段近乎全身心投入的时期。冥想、单口喜剧、家庭、工作和 LLM 都曾成为他连续多年深入阅读、倾听、练习与思考的对象。积累达到一定程度后,知识不再只是能够复述的信息,而会转化为直觉。人会开始在潜意识中连接不同概念,并逐渐形成判断力与品味。他并不相信存在永恒的完美平衡,更愿意把生活理解为骑自行车,向一边倾斜过多之后再主动修正。
https://x.com/realmadhuguru/status/2086537000136642846
Replit CEO Amjad Masad
Amjad Masad 发布了 HelpPeer,一个面向 AI agents 的公共知识网络,希望把 agent 的自发协作能力用于公共利益。HelpPeer 提供两个 API,分别是 tell 和 lookup。agent 学到可能帮助其他人的信息时,可以通过 tell 发布到网络;执行昂贵任务之前,则可以用 lookup 查询其他 agent 是否已经遇到并处理过相同问题。他用全球性软件供应链攻击举例,如果 10,000 个安全 agent 各自检测、调查和逆向分析同一个异常,将产生大量重复劳动。在 HelpPeer 的设想中,最先发现问题的 agent 可以公开结果,其他 agent 随后进行验证、扩展并继续发布新发现。测试期间,Replit Agent 已经自发分享了一条与其使用的 Codegen library 有关的技巧。HelpPeer 目前正在邀请用户把测试说明交给自己的 agent,参与 beta 验证。
https://x.com/amasad/status/2086628413322981747
Vercel CEO Guillermo Rauch
Guillermo Rauch 认为,在当前阶段完全不阅读 agent 生成的代码,通常意味着项目仍处于学习、原型、一次性软件或尚无用户与收入的阶段,也可能意味着团队正在主动承担技术债务和风险。他并不否定这些场景,但强调模型尚未达到完全自治。模型仍会犯初级错误,也可能沿着糟糕的架构方向持续推进。他最近看到一个顶级模型为了让某个流程“稳定下来”而加入毫无意义的 700ms 延迟,模型在被指出后承认自己只是在机械模仿惯例。他相信人工阅读代码的必要性会继续下降,未来大量代码可能像汇编语言一样退居底层。但全球互联网和软件基础设施正在依赖这些模型,因此团队不能只相信自动化叙事而忽略工程责任。现阶段,通过直接阅读或让 agent 追问代码细节来理解实现,仍然是控制风险的重要环节。
https://x.com/rauchg/status/2086513316265181213
Box CEO Aaron Levie
Aaron Levie 判断,agent 在不同行业中的普及速度会非常不均衡,关键取决于工作流能否支持连续、不中断的计算机操作。Agentic coding 增长迅速,是因为软件工作的经济价值可以直接对应纯数字产出,而且单次会话中的任务规模理论上没有上限。模型能力提升后,coding agent 可以几乎立刻承接更大的工作负载。销售、法律和医疗并不具备同样结构,因为销售需要等待客户反馈,律师需要与客户沟通,医生也必须与患者互动。如果所有员工同时请假,token 使用量可能大幅下降,因为目前多数 agent 仍在等待人类发出 prompt,而非在后台持续运行。未来的法律 agent 应该处理每一份新合同,销售 agent 可以持续扫描客户记录并寻找适合联系的信号,生命科学 agent 则可以系统阅读全部测试和研究材料。要实现这种模式,企业需要围绕 AI 重新连接和设计业务流程,而不能只把 agent 塞进现有的大量人工步骤中。因此,非编程领域的扩散将伴随更多变更管理、数据清理和工作流重构。
https://x.com/levie/status/2086559201053294909
Y Combinator CEO Garry Tan
Garry Tan 最喜欢从已经暴露出来的问题开始工作,而不是先构建宏大的抽象方案。入口可以是一个 bug、一处能力缺口、一项错误声明、一个只完成一半的工具,或者机构中的反常行为。接下来需要追问,什么隐藏机制会让这个可见的失败成为可能。找到机制后,应当修复根因,而不是只处理表面症状。完成一次修复后再寻找下一个异常,并把这一循环长期重复下去。
https://x.com/garrytan/status/2086615082163941460
FPV Ventures 合伙人 Nikunj Kothari
Nikunj Kothari 用 Fable 的经历说明,过度依赖 feature flags 会让产品默认行为变得难以理解。Fable 把大量功能放在以环境变量控制的 flags 后面,问题严重到他不得不在 Claude.md 中明确写入“默认值很重要,不要模棱两可”。这个教训指向 agent 编程中的一个具体风险,模型为了保留所有可能性,可能不断增加开关,而不是做出清晰的产品决定。他同时在寻找真正有效的 AI 多人协作体验。目前常见界面仍主要围绕单个人类与单个 agent 的配合设计,而多个人类与多个 agents 之间的协作尚未形成成熟范式。他提出的开放问题是,这种停滞究竟源于产品缺乏想象力,还是模型能力本身仍有限制。
https://x.com/nikunj/status/2086492103945900437
https://x.com/nikunj/status/2086438339419496449
SPC 普通合伙人 Aditya Agarwal
Aditya Agarwal 用 Wittgenstein 对语言的两次判断类比 AI 研究路线的变化。1921 年的 Wittgenstein 认为,语言必然拥有深层的逻辑结构。大约 30 年后,他转而主张不要继续寻找隐藏结构,而应观察语言在现实中如何被使用。类似地,1960 年代的 AI 研究相信智能背后存在可以明确表达的符号结构。大约 60 年后,主流突破却来自扩大 neural net 的规模,重点从预先规定智能结构转向让模型从使用与数据中学习。
https://x.com/adityaag/status/2086592574534602781
官方博客
Claude Code now supports artifacts
Claude Code 现在可以把工作进度捕获为 artifact,将 session 中的内容转换成实时、可分享的可视化网页。适用形式包括 PR walkthrough、系统说明、可筛选 dashboard、事故调查页和自动更新的发布检查清单。artifact 会利用当前 session 的完整上下文,包括代码库、connectors 和对话内容,因此可以把失败测试、相关函数、监控工具中的错误峰值及根因分析组合到同一页面。用户无需额外连接数据源或部署基础设施,只需要求 Claude Code 创建一个页面。artifact 更新后,已经打开的页面会原地刷新,每次发布都会在同一个 URL 下生成新版本。系统同时提供版本历史、恢复能力和用于管理已有 artifacts 的 gallery。调试场景中,页面可以随着调查推进持续补充时间线、可疑 commits 和错误率图表,让工程团队与利益相关者看到相同上下文。每个 artifact 默认仅作者可见,分享后也只允许组织内已认证成员访问,不能公开发布。管理员可以通过组织级开关、角色范围、保留策略和 compliance API 管理访问与审计。该功能目前以 beta 形式向 Claude Team 与 Enterprise 组织开放,可从 Claude Code CLI 和桌面应用创建,并在浏览器中查看。
https://claude.com/blog/artifacts-in-claude-code
播客
Unsupervised Learning — Ep 92: xAI Co-Founder Unpacks the Future of Model Development
核心要点: agent 的下一阶段不只是继续提高 coding 能力,而是把可验证任务中的成功方法扩展到科学发现、个人 AI 与现实世界反馈,同时让更多人真正拥有 AI 带来的价值和控制权。
Igor Babushkin 现正创办 River AI,此前曾在 DeepMind 负责 StarCraft 与 AlphaCode 相关工作,在 OpenAI 参与早期 reasoning 研究,后来联合创办 xAI,并参与 Colossus 和模型研发。他将去年 11 月至 12 月视为软件工程的重要转折点,当时新一代 coding agents 强大到研究人员和工程师已经无法忽视。很多曾经排队等待的个人项目突然变得可实现,但能力快速增长也让开发者像“魔法师的学徒”一样,既获得力量,又必须面对力量失控的可能。
Coding 和数学仍是 agent 最自然的突破口,因为结果可以验证。代码能通过测试确认,数学定理与证明则可以借助 Lean 等工具形式化,从而提供明确的 reward signal。科学发现的难点不同,agent 设计新材料、研究基础物理或改进火箭发动机时,必须通过现实实验判断方案是否有效。真正的瓶颈因此不只是模型推理,而是如何闭合模型与物理世界之间的数据反馈循环。
个人 AI 不一定需要证明黎曼猜想,却必须理解用户的生活、工作和环境,并代表用户采取行动。Igor 认为,当前“大规模预训练、提供 API、按 token 收费”的模式只是行业形成的一组假设,并非 AI 唯一的构建与分发方式。River AI 正在探索新的模型构建、定制和交付路径,希望让企业和消费者更直接地控制 AI 的行为与使用体验。他强调:“让 AI 的收益与对 AI 的控制权得到更广泛的分配,本身就是 AI safety 的一部分。”
他认为眼前更迫切的风险不是遥远的模型接管,而是 AI 放大不平等,一部分人获得巨大收益,另一部分人却被落在后面。开放模型在接近危险能力门槛、但尚不足以造成现实伤害时尤其有价值,因为全球研究者都可以用它们测试 alignment、控制和网络安全方案。AI 安全不能只由大型实验室中的少数人研究。对 builders 而言,重要的不只是继续追逐最高能力,还要设计能够分配价值、扩大参与并让普通人保有控制权的技术与产品。