X / 推特
AI Builder Swyx
Swyx 提醒用户暂时不要使用 Codex 的“locked use”能力。该功能当前依赖不稳定的 macOS 特性,本周已经两次导致他无法访问自己的 macOS Keychain。他引用 Apple Developer Forums 的信息称,这是一个已知问题。虽然把相关操作全部放到云端可能避开本机风险,但他认为目前云端能力尚未成熟。对依赖 Codex 操作系统权限或凭证的用户而言,现阶段更稳妥的选择是避开该功能,等待底层问题修复。
https://x.com/swyx/status/2092492963435946494
OpenAI Codex 与 ChatGPT 产品成员 Thibault Sottiaux
Thibault Sottiaux 介绍了一项面向团队和小型公司的产品方案,其使用方式接近 Pro $100 计划。方案覆盖 ChatGPT、ChatGPT Work 和 Codex 的全部功能,并可连接 Google Workspace、Slack、GitHub、Microsoft 365 等服务。企业管理能力包括安全工作区、SAML、SSO、MFA、集中账单与统一管理。团队还可以查看使用分析,并通过支出控制管理成本。该方案没有 5 小时使用限制,重点是在个人高额度方案与企业协作需求之间建立连接。他同时表示,好产品需要时间,并以“至少 34 天”概括其开发周期。
https://x.com/thsottiaux/status/2092345330272780499
https://x.com/thsottiaux/status/2092487667426738179
实用 AI 教程创作者 Peter Yang
Peter Yang 开源了免费 AI skill `/fuck-cancer`,帮助癌症患者及照护者整理诊断、治疗和沟通信息。它会生成一份持续更新的实用 brief,集中保存患者与医疗团队资料,并把下一步行动限制为三个明确事项。文档会分别记录已确认事实与仍不明确的问题,同时用通俗语言解释医疗术语。第五个部分是包含近期进展与决策的照护日志,方便家属维护单一信息来源。该 skill 可以读取用户提供的文档和背景信息,在需要研究时使用 National Cancer Institute、ClinicalTrials.gov API 等来源。Peter 使用 ChatGPT、Codex 和 Claude Code 来准备沟通及研究,结果既可保存为本地 Markdown,也可同步到供家人协作的 Google Doc。他强调,这项工具的目标是帮助患者提出问题、推动检查,并应对医生、文档和保险材料迅速累积带来的压力。
https://x.com/petergyang/status/2092249012913258946
https://x.com/petergyang/status/2092311110871617915
Meta AI 高级总监 Madhu Guru
Madhu Guru 发布了 eval 系列第九篇,讨论“The Eval Roadmap Problem”。他的核心判断是,大量 eval 失败并非测试本身完全错误,而是团队把它当作静态产物,忽略了用户预期和使用行为正在升级。以金融研究 agent 为例,需求可能从总结一份 5 页财报,发展到比较最近 5 份财报,再扩展到结合 15 份文件建立投资论点,最终变成持续监控投资组合并主动预警。对应的 eval 也必须从短上下文迁移到长上下文单轮问答、多轮引用、文档与行级引用,并从简单 QA 走向复杂综合和主动 agent。团队应识别轮次、文档规模、工具使用、自主程度和用户旅程覆盖等演化维度,再确定下一阶段的 P0 eval。Madhu 建议持续访谈用户、分析生产 traces、寻找行为变化,并根据失败模式反复改进。若 eval 仍停留在第一周,而用户已经进入第三周的复杂用法,差距最终会体现在产品质量和流失指标中。
https://x.com/realmadhuguru/status/2092426017118028266
https://x.com/realmadhuguru/status/2092461206783373758
Anthropic Claude Code 与 Cowork 产品成员 Cat Wu
Cat Wu 宣布 Claude 已经统一 Chat 与 Cowork 之间的 memory。用户只需告诉 Claude 一次需要记住的内容,相同背景就能跨两个使用界面生效。这样,从聊天讨论形成的项目背景可以直接进入 Cowork 的任务流程,无需重复说明。此次更新来自用户反馈,重点是降低跨产品切换时的上下文损耗。Cat 也邀请用户继续提出希望加入 memory 的后续能力。
https://x.com/_catwu/status/2092337156455051345
Google AI 实验平台 Google Labs
Google Labs 推出了协作式 vibe coding 实验 Play with Putty。它允许多人实时共同构建工具和网站,把个人式 AI 编程扩展为多人协作流程。产品强调共同创作,参与者可以围绕同一个想法同步推进实现。当前用户需要先加入 waitlist,并向团队提交使用反馈。该实验目前仅面向美国地区的 18 岁以上用户。
https://x.com/GoogleLabs/status/2092293667688173593
Vercel CEO Guillermo Rauch
Guillermo Rauch 发布 Run SDK,用于在动态 Code Mode 中安全执行 agent 生成的代码。它采用轻量级 QuickJS 安全上下文,适用于不需要完整 sandbox 的任务,目标是降低执行延迟和成本。开发者可以通过 `npm i run` 安装。Guillermo 同时宣布 Vercel Connect 已进入 GA,聚焦 agent 连接服务和数据时的安全问题。开发者可以运行 `vercel connect create notion` 创建连接,并获得一个代表已认证用户执行查询的 MCP client。这两项能力分别处理 agent 的代码执行与外部服务访问,构成两类关键基础设施。其共同方向是让 agent 在更小的运行开销下,安全调用代码、身份和业务数据。
https://x.com/rauchg/status/2092382653161107534
https://x.com/rauchg/status/2092352411839193234
Box CEO Aaron Levie
Aaron Levie 认为,基础 AI 模型与企业实际工作流之间仍存在很大距离,这为 applied AI 公司留下了重要机会。企业真正需要的不是原始模型或孤立 agent,而是问题得到解决、结果能够交付。要跨越这段距离,产品必须理解行业上下文,并推动组织内部的 change management。技术层面还需要能路由不同模型的 harness、关键业务系统连接,以及把用户和 agent 放入正确工作流的 UX。团队还必须掌握所在领域的 eval,才能判断 agent 是否真的完成了业务目标。Aaron 的判断是,超越模型智能本身的整套落地能力具有大量价值,目前正是建立各企业关键领域代表性公司的窗口期。
https://x.com/levie/status/2092466424694649066
FPV Ventures 合伙人 Nikunj Kothari
Nikunj Kothari 推出了 El Niño situation monitor,集中呈现 El Niño 的实时动态。网站汇总政府来源的信息与新闻,并按地区说明影响和成本。它还收录历史记录,帮助用户理解当前读数的重要性。针对不同指标和术语,网站提供 glossary 与 FAQ,降低非专业用户的理解门槛。该项目最初受到 Odd Lots 一期内容启发,使用 ChatGPT Codex 和 Railway 构建。界面细节借助 Emil Kowalski 的 skills 与 Kasturi 的 generative loaders 完成,Nikunj 也公开邀请用户提供反馈。
https://x.com/nikunj/status/2092383834470002922
https://x.com/nikunj/status/2092384774459674957
SPC General Partner Aditya Agarwal
Aditya Agarwal 认为,公众反感数据中心扩建并不令人意外。当前 AI 的主要受益者仍是知识工作者以及收入最高的人群,因此大规模基础设施建设与普通人的直接利益之间存在距离。他判断,当 AI 能够帮助找到困扰所有人的疾病疗法时,公众态度可能发生重大变化。他认为相关方向已经开始出现希望,也能解释为什么一些最聪明的人开始把注意力转向医疗问题。Aditya 同时批评 AI 行业长期强调风险和恐惧,却没有充分描绘一个积极、可感知的未来。要获得更广泛的社会支持,AI 需要用普遍可见的真实成果证明基础设施投入的价值。
https://x.com/adityaag/status/2092290497826173186
Anthropic AI 助手 Claude
Claude 现在会在 Chat 与 Claude Cowork 之间使用同一套 memory。Cowork 接到任务时,可以直接利用用户此前在聊天中讨论的项目背景、管理者偏好或客户信息。所有已保存内容会以主题列表形式出现在 Settings 中,用户可以逐项阅读、编辑或删除。memory 会随着聊天自动更新,持续保存新出现的相关细节。用户也可以明确说出“remember this”,要求 Claude 记录某一项信息。此次设计在跨界面连续性之外,也把记忆内容的查看与控制权交给用户。
https://x.com/claudeai/status/2092299704864284888
https://x.com/claudeai/status/2092299707653439497
播客
Training Data — Parallel’s Parag Agrawal: Building a New Web for AI Agents
核心要点:Parallel 判断,面向 agent 的搜索不能继续依赖人类点击数据,而要围绕 agent 的任务反馈,重新设计索引、排序、接口和互联网商业模式。
Parag Agrawal 曾任 Twitter CEO,如今创办 Parallel Web Systems,目标是让 agent 能够搜索和使用整个 Web。他的出发点是,agent 未来使用网络的频率可能达到人类的 1000 倍,因此传统搜索引擎为人类浏览、点击和关键词输入建立的技术栈并不够用。
第一个关键变化是反馈机制。Parag 的原话是:“在 Parallel 看来,人类点击数据是一个 bug,使用搜索完成工作的 agent 应该依赖 agent 反馈,而不是人类反馈。”传统搜索依靠大量点击和人工评分判断结果好坏,年轻公司很难复制这种规模优势。现在,大模型可以压缩信息并更低成本地产生评价数据,使团队有机会把模型研究应用于索引与排序。
第二个变化是从慢速 agent 切入,而不是第一天就复制完整搜索引擎。Parallel 最初推出的是 search agent,它可以在查询到达后再抓取网页。深度研究任务允许等待一分钟,有些产品甚至会研究十分钟,这给实时抓取和页面筛选留下空间。Parag 把索引视为一种延迟优化,团队先与人工资料搜集竞争,再通过客户任务逐步建设更大、更复杂的索引,早期场景包括保险承保、理赔和销售流程。
第三个变化是质量、成本与延迟的联合优化。Parallel 的目标不是训练另一个超大基础模型,而是把能力压缩到小型排序模型中,从数以万亿计的网页里选出最有价值的约 1000 个 token。Parag 表示,使用 Parallel Search 通常能让 agent 消耗不到一半的 token,同时提高准确性和速度。更少的噪声意味着模型可以在相同上下文限制下处理更多问题,或者以更低成本完成同一任务。
第四个变化发生在互联网经济层。广告之所以高效,是因为有限的人类注意力能够转化为点击、购买和订阅,并通过差异化定价补贴大量免费内容。当访问者变成无法识别的 agent,内容方无法判断一次抓取是否会带来订阅,也无法用现有广告模式变现,因此可能选择阻止 agent。固定费用的数据授权同样难以跟上 AI inference 以倍数增长的使用量,内容方在续约时可能发现自身收入占比持续下降。
Parag 把未来分为三个层次:agent 把 Web 当搜索工具,更复杂的多 agent 系统相互唤醒和编排,以及 Web 从 pull 转向 push。最终,agent 不再反复询问“现在帮我找什么”,而是持续监测网页、卫星图像或客户评论的变化,并在事件满足条件时主动触发工作。届时,为 agent 编写可读取的 API 文档、内容和数据接口,将与面向人类设计网页同样重要。
https://www.youtube.com/playlist?list=PLOhHNjZItNnMm5tdW61JpnyxeYH5NDDx8