X / 推特
OpenAI Codex 与 ChatGPT 团队 Thibault Sottiaux
Thibault Sottiaux 将本周的主题概括为“便宜到无需计量的智能”,并预告团队明天还会发布新内容。GPT-5.6 Sol 在 ARC-AGI-3 上取得了 SoTA,但关键并不是重新训练模型,而是调整了两个设置。测试允许模型充分推理,并借助 OpenAI 的标准 compaction 实现跨多个上下文窗口持续工作。这说明模型的实际能力不仅由权重决定,也受到运行方式和上下文管理能力影响。他同时提醒开发者重视 agent harness,因为支撑模型工作的执行框架会直接影响模型表现。结合其推荐的一篇调查文章来看,如何构建和加固 harness 正成为释放模型能力的重要工程问题。
https://x.com/thsottiaux/status/2082655731204096275
https://x.com/thsottiaux/status/2082637967852806207
https://x.com/thsottiaux/status/2082609662231502932
AI 实用教程创作者 Peter Yang
Peter Yang 在享受 AI 带来的效率提升后,开始警惕三种负面使用模式。第一种是懒得阅读原文,只看 AI 摘要,或者让 agent 大规模修改文件却不认真检查结果。第二种是随时通过手机给 agent 反馈,并把这种持续在线误认为生产力,即使当时本应陪伴孩子或处理现实生活。第三种是更愿意与 ChatGPT Voice 讨论想法,而不是和身边的真人交流。在设计工作中,他特别认可 Claude Design 创建内容前主动提出澄清问题,因为这些问题能迫使使用者先想清楚需求。为了避免生成千篇一律的“Claude 风格”,他会预先创建 design.md,明确颜色、字体和其他视觉规范。他建议通过 Mobbin MCP 收集喜欢的设计模式与应用界面,也可以参考 designmd.sh 中的现成规范库。其核心方法是先用参考案例和明确约束建立设计语言,再让 AI 执行具体原型任务。
https://x.com/petergyang/status/2082642205811106158
https://x.com/petergyang/status/2082579428090192192
https://x.com/petergyang/status/2082519030859264086
Google AI 实验平台 Google Labs
Google DeepMind 发布了 Lyria 3.5,并将其直接接入 Google Flow Music。新版本提高了对提示词的遵循能力,让创作者可以更准确地控制音乐方向。它支持设置精确 BPM,也能导出完整歌曲的分轨文件,方便后续制作。人声部分强调更丰富、更有表现力和动态感的演唱效果。编曲衔接也得到改善,使音符和段落之间的流动更加自然。这次升级的重点是把生成音乐从一次性成品进一步推进到可精确控制、可继续编辑的制作素材。
https://x.com/GoogleLabs/status/2082501360466174163
Replit CEO Amjad Masad
Amjad Masad 表示,不同模型在视觉任务上各有所长,有的擅长 CSS,有的擅长 SVG,还有的更适合制作动画。Replit Design 没有把全部任务押在单一模型上,而是同时使用表现最合适的开放模型和闭源模型。其目标是通过模型组合获得更好的审美质量,而不只是完成可运行的页面。Masad 将它称为目前在品味、趣味性和易用性方面表现最好的 AI 设计工具。他提出的方向意味着设计产品正在进入“post-prompt era”,竞争重点开始从用户如何写提示词转向系统如何在后台编排模型。
https://x.com/amasad/status/2082508826767679668
https://x.com/amasad/status/2082505558293467363
https://x.com/amasad/status/2082504898801999990
Box CEO Aaron Levie
Aaron Levie 认为,当 AI 能力增强时,推理资源会优先流向经济价值最高的任务,低价值需求可能被挤出。稀缺环境理论上会让推理成本因高价值需求而上涨,但他不认为价格会简单地沿着这条路径失控。原因是大量模型提供商和基础设施公司都希望争夺这些工作负载,市场竞争会持续压低价格,直到供给能力追上需求。他同时指出,OpenAI agent sandbox escape 对企业采用 AI 有直接影响,因为它同时展示了 agent 的能力和现有环境的脆弱性。企业需要限制 agent 可访问的数据,保留审计轨迹和治理能力,并重新判断哪些系统必须保持确定性。访问控制过期可能让一个善意 agent 在执行“寻找项目最重要知识产权”时发现本不该暴露的信息,恶意行为者带来的风险则更高。与人相比,agent 可以无限期执行任务,不承担真正的越权后果,也缺少判断任务是否合理的成熟能力。企业因此需要新的数据保护、快速阻断和 agent 防御体系,这会创造安全创业机会,同时延长高度自主 agent 在企业中的普及时间。
https://x.com/levie/status/2082658870523248967
https://x.com/levie/status/2082514776392175844
Cursor 设计师 Ryo Lu
Ryo Lu 宣布 Cursor 已可在 iOS 上使用。产品传达的核心场景是让用户在任何地点访问自己的 agents。移动端意味着 agent 工作流不再完全绑定桌面开发环境。发布帖只明确了“随时随地访问 agents”这一定位。此次发布的信息重点是可达性扩展,原文没有进一步说明功能范围、价格或平台限制。
https://x.com/ryolu_/status/2082539893729972320
Builder Zara Zhang
Zara Zhang 认为,深厚的领域知识与 AI-native 工作方式结合,会形成非常强的个人竞争力。仅有既往经验还不够,专业人士还需要持续重塑自己,采用新的工作方法。她同时强调,营销能力不仅影响推广,也会反向提升产品质量。许多技术人员面对的是想象中的受众,并没有接触用户如何理解和使用产品的现实。营销迫使建设者观察真实认知、表达方式和使用行为,因此也是一种产品反馈机制。她的两项判断共同指向同一个原则:专业积累需要与新工具和真实市场接触同时更新。
https://x.com/zarazhangrui/status/2082705944782520462
https://x.com/zarazhangrui/status/2082684904136134881
Every CEO Dan Shipper
Dan Shipper 表示,Every 团队几乎所有人都对 ChatGPT for Work 的语音模式评价很高,团队内部已经很久没有出现如此集中的兴奋感。他也关注到 agent 安全事件带来的防御需求。相关案例中,OpenAI 的安全分类器被关闭,模型还收到明确执行漏洞利用的指令,因此不能把结果简单归因于正常使用状态。与此同时,HG 的 AI 确实自动发现了攻击,只是没有将其标记为足够高的严重等级。他判断,未来恶意行为者会主动利用模型实施类似操作。任何处理敏感客户数据的公司都将需要自动化、agent 化的防御系统。对创业者而言,能够持续发现、判断并阻断其他 agent 行为的安全产品可能形成巨大机会。
https://x.com/danshipper/status/2082613916706693560
https://x.com/danshipper/status/2082608994275725650
South Park Commons 普通合伙人 Aditya Agarwal
Aditya Agarwal 用“19 岁的 LeBron 只剩两年赚钱窗口”比喻 AI 研究人员的处境。他认为,一些研究者感觉机器人即将接管相关工作,因此像只剩 18 个月进攻时间的 MVP,这种压力可以解释行业中的大量争议。在 South Park Commons 的 Demo Faire 上,他观察到投资者对机器人、无人机和半导体等 frontier technology 兴趣强烈。投资者不仅关心财务曲线,也愿意深入讨论创始人究竟在建设什么。与此同时,优秀软件的门槛已经显著提高。若产品只是类似 vertical SaaS 或 agent-for-X,就必须展示真正不同的愿景,或者极其迅猛的增长速度。他认为,早期投资的真正乐趣应当是参与建设未来,而不只是寻找持续向上的图表。长期来看,Silicon Valley 最擅长的仍是让整个生态共同支持那些需要数十年才能成熟的项目。
https://x.com/adityaag/status/2082558632705896899
https://x.com/adityaag/status/2082538703432630398
AI 关注者 Sam Altman
Sam Altman 表示,能够显著加速科学发现的模型已经非常接近。他认为,实现这一目标的最佳方式不是让 AI 公司独自解决所有科学问题,而是把能力交给科学家。这里的重点是让专业研究人员掌握更强的研究工具。模型承担的是加速作用,科学家仍然是提出问题和推进发现的主体。他同时强调,科学进步带来的收益应当惠及所有人。
https://x.com/sama/status/2082628413769003269
官方博客
Building intelligent apps for Apple platforms with Claude in the Foundation Models framework
Anthropic 发布了一个新的 Swift package,让 Apple 开发者能够通过 Foundation Models framework 调用 Claude。Apple 的框架适合使用设备端模型完成快速、本地的摘要与信息提取,并可通过 guided generation 在少量代码中返回带类型的 Swift 值。当任务需要多步推理、代码生成、联网搜索或数据分析时,应用可以把整理好的输入交给 Claude。Claude 的流式响应、工具调用和结构化结果仍会返回同一个 SwiftUI 视图,由 package 处理衔接过程。这让应用可以为不同步骤选择合适的模型,例如先在设备端生成日记提示,再由 Claude 跨数月记录寻找线索。学习应用也可以先在本地解释术语,遇到需要关联整个课程的问题时再转交 Claude。该文章发布于 6 月 8 日,并称相关支持将在其发布次日开放,适用于 iOS 27、iPadOS 27、macOS 27、visionOS 27 和 watchOS 27,开发者需要使用 Anthropic API key 登录。
https://claude.com/blog/claude-for-foundation-models
播客
AI & I by Every — Best of the Pod: Wired's Kevin Kelly on Why AI Is a 50-year Overnight Success
核心要点:技术突破经常以“一夜成功”的面貌出现,但真正决定时间表的,往往不是想象力,而是被忽略的物理约束、基础设施和意外用途。
Kevin Kelly 长期观察互联网、AI、VR 与其他技术浪潮,也坦率记录自己的误判。他在 1987 年看到 Jared Lanier 展示 VR 时深受震撼,认定它会迅速成为未来。几十年后,VR 的核心体验并没有发生百万倍提升,最明显的变化是设备从数百万美元降到了约 $100。他由此总结:“预测未来很容易,做出正确预测很难。”
第一个反直觉判断是,物理世界中的技术扩散会比纯软件慢得多。VR 不只面对硬件问题,还要处理眼睛对焦、头部承重等生物限制。机器人面临的差距更大,人脑是约 25 瓦的“超级计算机”,人体运动系统却只有约四分之一马力,当前机器很难接近这种能效。因此,他预计机器人普及所需时间会远长于许多人的判断。
第二个判断是,重大突破可能来自原目标之外。LLM 并非通过直接攻克推理而起步,研究者是在语言翻译能力中意外观察到推理现象。VR 或 AR 等待的“LLM moment”也可能来自镜片、对焦、投影或其他相邻技术,而不是现有路线的线性改进。目前还看不到这个关键突破已经发生。
第三个判断是,人类对 intelligence 的理解仍处于非常早期的阶段。Kelly 将当下类比为早期科学家研究 electricity 的时期,当时连 Isaac Newton 都提出过错误理论。Royal Academy 的早期活动包含售票展示电火花的实验,人们甚至曾认为 electricity 主要是一种生物现象。他怀疑 intelligence 不是一种单独元素,而是多种尚未识别的认知成分构成的 compound。今天的 AI 就像人们已经能制造“盐”,却还不知道盐由哪些元素组成。
第四个判断涉及创新边疆与治理。早期互联网和 Burning Man 都曾拥有混乱、自由、无需许可的状态,但随着风险出现,道路、规则、警务和组织结构会逐层建立。Kelly 并不认为秩序只会破坏创新,因为成熟治理通常也会扩大参与规模。更理想的状态是不断开辟新边疆,让适合无规则探索的人继续试验,同时让擅长在规则中建设的人把成果转化为稳定系统。
他自己的平衡方法是短暂进入技术前沿,然后回到历史与实体世界。研究最新 AI 的同时,他会阅读 electricity 的发现史,也会在工作室中动手制作东西。理解未来不仅需要追逐下一次发布,还要同时观察过去一万年、未来一万年,以及那些长期不变的人类条件。
https://www.youtube.com/playlist?list=PLuMcoKK9mKgHtW_o9h5sGO2vXrffKHwJL