X / 推特
Anthropic Claude Code 团队 Boris Cherny
Boris 推荐阅读最新的 Threat Intelligence 报告,认为随着模型能力增强,缺少恰当的安全防护和监控会让风险同步上升。编码和生物研究等能力具有明显的双重用途,既能帮助开发软件或推进科研,也可能被用于攻击关键基础设施或制造生物威胁。谈到 AI 生成代码,他主张根据用途设定不同标准,低影响且注定丢弃的原型可以作为黑盒处理,生产代码则应接受比人类代码更严格的质量要求。Anthropic 为此使用大量 lint 规则、测试、Claude 驱动的端到端测试、每日 fuzzing、自动代码审查、安全审查和重构流程。他建议优先使用最新 frontier model,提高推理 effort,并通过 CLAUDE.md 和 skills 清楚说明代码库规范;如果仍不达标,就需要增加人工引导或让 Claude 主动偿还技术债。
https://x.com/bcherny/status/2098281805770309686
https://x.com/bcherny/status/2098217573276131577
OpenAI Codex 与 ChatGPT 团队 Thibault Sottiaux
Thibault 介绍了一套可按需扩展 agent 的 API,其底层基础设施与 ChatGPT Work 所使用的系统基本一致,开发者可以在一分钟内开始构建。他还提到,OpenAI 内部团队普遍使用一款数据工具制作 dashboard 并了解业务,已经成为日常工作中不可缺少的基础设施。与此同时,Astra 的系统容量正面临压力。为了尽可能保障现有用户的体验和持续访问,团队将暂停新的 200 美元 Pro 计划订阅。现有账户不受影响,其他订阅计划和 API 仍然开放,团队正在尽快增加容量。
https://x.com/thsottiaux/status/2098238138334548260
https://x.com/thsottiaux/status/2098165551554240764
https://x.com/thsottiaux/status/2098113585683808624
Meta AI 高级总监 Madhu Guru
Madhu 在 eval 系列第十部分提出,评估 agent 时不能只看最终答案,还要测量完成任务的每一步。两个 agent 即使都得到 42,过程质量也可能截然不同,一个可能找到正确来源、取回正确文档并用 4 次干净的工具调用完成计算,另一个则可能调用 17 次、重复搜索并经历多次错误恢复。她建议先完整定义工作流,再明确每一步所包含的任务。随后需要为各步骤设计衡量方式,判断应该建立独立 eval,还是把它作为大型 eval 的一个切片。评测集还应同时覆盖中位难度和困难任务,而分析结果时应先检查执行轨迹,再看最终答案。
https://x.com/realmadhuguru/status/2098064969464217720
Anthropic Claude Code 团队 Thariq
Thariq 分享了一个用于改善 Claude 个性化上下文的提示词。用户可以要求 Claude 针对尚不了解、但与后续协作相关的个人经历进行深入访谈。开放性问题可以采用自由文本,多项选择题则可以使用 askuserquestion 工具。访谈得到的信息随后被保存到 memory,供未来对话继续使用。这个方法的重点不是一次性补充背景,而是让 Claude 主动识别信息缺口并建立更完整的长期上下文。
https://x.com/trq212/status/2098157600361861579
Google AI 工具与实验团队 Google Labs
Google Labs 宣布 Dreambeans 已向美国所有年满 18 岁的用户开放。产品同时登陆 iOS 和 Android,并且可以免费使用,不要求订阅。用户现在还可以把 Gemini app 连接到 Dreambeans。连接之后,Dreambeans 会利用 Gemini 对既有聊天内容的理解,生成更有洞察力和个性化的每日故事。其产品定位是每天提供一组新鲜生成、结合用户语境的故事内容。
https://x.com/GoogleLabs/status/2098110018289803558
Replit CEO Amjad Masad
Amjad 承认 AI 带来了大量真实风险,并特别指出自己十分担忧网络安全。他认为这些风险值得持续关注和处理。不过,他反对把“灭绝风险”列为现实威胁,即 AI 导致全人类死亡的情景。在他的判断中,这种风险与网络安全等正在发生、能够观察到的问题并不处于同一层级。其观点主张将注意力放在具体且可操作的 AI 风险上,而不是以人类灭绝作为讨论中心。
https://x.com/amasad/status/2098171265924116732
Vercel CEO Guillermo Rauch
Guillermo 提出,应当为每个 agent 在每个区域提供一台计算机,反映出 agent 工作负载对分布式计算资源的需求。Vercel 每天约完成 1000 万次部署,累计部署量已达到 23.5 亿次。数十亿个应用部署可以同时存在,并通过 Vercel 的 CDN 被路由访问,其底层全球元数据存储能够在数百毫秒内完成跨区域同步。团队最近将该系统的 p99 性能提升了 91%,同时加快从 build 到 deploy 的流水线。此次优化发生在 agentic deployments 快速增长、系统承受巨大压力的背景下,直接改善了回滚、配置变更和路由添加等操作。
https://x.com/rauchg/status/2098158541932794222
https://x.com/rauchg/status/2098091056302833837
https://x.com/rauchg/status/2098066258155708851
Box CEO Aaron Levie
Aaron 与银行、媒体、信息服务、保险和咨询行业的数十位技术负责人交流后,总结了企业部署 agent 的几个共同趋势。企业最现实的担忧是网络安全、漏洞增长以及 agent 身份管理,同时多数公司仍在并行部署多个 frontier model,很难统一到单一模型或供应商。开放权重模型在大型组织中的规模化采用仍处于早期,企业支出也主要集中在少数供应商。更高的 ROI 来自重新设计工作流,让 agent 改变工作本身,而不是简单叠加到既有流程上,但推动这种组织变革的负责人仍不明确。企业还在频繁更换技术架构和供应商,eval 能力整体尚不成熟,遗留系统及其碎片化数据继续拖慢落地速度。Box 也在深化与 OpenAI 的合作,让用户能够在 ChatGPT 中安全使用企业内容,并由 AI agent 跨系统处理数据和执行流程。
https://x.com/levie/status/2098218284139311615
https://x.com/levie/status/2098135659714085281
FirstMark Capital VC Matt Turck
Matt 发布了与 Richard Socher 围绕 recursive self-improvement 和科学进步的长篇交流。内容从科学进步放缓谈起,讨论 AI 是否能够重新连接被高度专业化切割的人类知识。双方进一步分析了 LLM 如何学习生物学和蛋白质,以及 next-token prediction 为什么可能形成一种有效的 world model。后续话题覆盖 simulation、verifier、AI hallucination、药物发现、癌症研究、能源、材料和 AI economist。交流还涉及科学数据瓶颈、虚拟细胞、自主机器人实验室、agent swarm、算力限制,以及 Recursive 首先计划构建的方向。
https://x.com/mattturck/status/2098081448330674182
https://x.com/mattturck/status/2098081452839637480
FPV Ventures 合伙人 Nikunj Kothari
Nikunj 总结了当前早期风险投资市场中的三个现象。第一,许多创业者都希望筹集 5000 万美元的 seed round。第二,许多团队预计自己明年能够达到 3000 万美元 ARR。第三,热门的分期 seed round 往往最终落在约 3 亿美元估值。他还展示了自己的快速写作流程,从通勤时录制 voice memo、白天继续补充,到两场会议之间集中写作 30 分钟,快速通读后直接发布,并指出 Claude 的语音转录仍需改善。
https://x.com/nikunj/status/2098078391065018816
https://x.com/nikunj/status/2098255116751257663
OpenClaw 与 OpenAI Builder Peter Steinberger
Peter 赞同一个面向 AI 编程时代的软件设计判断,即重复逻辑已经不再像过去那样痛苦,而抽象仍然会带来成本。生成式编程降低了复制和改写实现的难度,因此传统上为了避免重复而建立抽象层的收益正在变化。相比之下,抽象仍要求开发者理解边界、维护接口,并承担错误设计带来的长期约束。这意味着 DRY 等经典原则在 agent 生成代码的环境中可能需要重新权衡。其核心提醒是,不应因为消除重复而自动引入抽象,具体实现有时反而更容易生成、检查和替换。
https://x.com/steipete/status/2098089196800098798
Anthropic AI 助手 Claude
Claude 宣布 Fable 5.1 Build Days 将于本周开始。Claude 社区将在世界各地多个城市举办 buildathon。活动时间从 9 月 11 日持续至 9 月 25 日。参与者可以带着一个具体问题或产品想法到场,也可以直接参与并探索 Fable 5.1 能够完成什么。官方同时提供了 RSVP 入口,方便开发者查询并报名相关城市活动。