X / 推特
OpenAI Codex 与 ChatGPT Thibault Sottiaux
Thibault Sottiaux 延续了对 ChatGPT Work 使用场景的收集,但这次把问题从工作效率转向更个人化的影响。他说自己读到大家关于 ChatGPT Work 的私信后很受启发,于是想收集另一类会让团队开心的故事:ChatGPT 曾在什么时候对你或身边人的生活产生过“深度正面影响”。这条内容本身不是产品发布,但能看到 OpenAI 团队在主动寻找超出功能指标的用户反馈。它关注的是 ChatGPT 在真实生活、关系、学习、工作之外的具体改变,而不是单纯问用户喜欢哪些功能。对 builder 来说,这也是一个提醒:AI 产品的价值叙事不只来自 benchmark、效率提升和工作流集成,也来自用户愿意主动讲出来的转折时刻。
https://x.com/thsottiaux/status/2079058139207573541
AI 教程创作者 Peter Yang
Peter Yang 继续围绕 Codex 和 ChatGPT Work 的产品体验提出具体反馈。他提到 Codex 正在帮他处理一场与 Google Adsense 支付相关的长期问题:他的 YouTube 频道已经有 100K+ 订阅,但至今没有从 Google Adsense 收到一美元付款,客服体验也很糟糕,只能尝试通过其他 Google 联系人解决。另一条反馈更直接指向产品文案:他认为很多 ChatGPT Work 的非技术用户并不知道“run this chat in the cloud”是什么意思。在 Codex 里,系统提示他发送到 Codex Web,但点开链接后却又提示下载 app,这让流程显得重复且困惑。Peter 的重点不是质疑云端运行本身,而是指出面向非技术用户时,文案和跳转路径会直接决定功能是否可理解。整体看,他今天的内容把 AI 工具的真实落地问题拉回到两个很具体的层面:用户支持能否解决真实商业问题,以及产品语言能否被非技术用户立即看懂。
https://x.com/petergyang/status/2079053957532655890
https://x.com/petergyang/status/2079053505969676404
https://x.com/petergyang/status/2079007381695172797
Anthropic Claude Code 与 Cowork Cat Wu
Cat Wu 分享了自己用 Claude Cowork 管理日历的具体 prompt。她让 Cowork 为自己管理一周日程,并设定了几个明确约束:会议总时长低于 20 小时,去重冲突会议,参考过去几周判断哪些类型的会议通常会被她拒绝,晚餐不计入 20 小时。她还要求 Cowork 构建一个会持续 refine 的 skill,并且在更新邀请前必须先询问她。这组指令的价值在于,它不是让 AI 做一次性的日程整理,而是把个人偏好、历史行为、硬性约束和人工确认流程组合进一个可迭代的工作代理。对使用 agent 的人来说,最值得借鉴的是“先让它学习你过去如何拒绝会议”,这比单纯给出“帮我优化日历”更可执行。Cat 最后询问大家用 Cowork 做什么,也显示 Anthropic 团队正在从真实工作场景中收集 agent skill 的使用模式。
https://x.com/_catwu/status/2079011428380602526
Anthropic Claude Code Thariq
Thariq 发布了两条与 Claude Code 和 skills/system prompts 相关的更新。第一条是面向遇到问题的用户的修复通知:如果碰到相关 bug,请重启 Claude Code,修复应该正在传播中。虽然他没有展开 bug 细节,但这条信息对正在使用 Claude Code 的用户是明确操作建议。第二条更值得关注,他说自己正在写一篇文章,总结团队在相关工作中学到的东西,以及用户如何把这些经验应用到自己的 skills 和 system prompts。这里的重点是 Claude Code 团队不只是发布功能,也在尝试把内部实践抽象成可复用的方法论。对 builder 来说,skills 和 system prompts 正逐渐从“提示词技巧”变成一种产品级配置与工作流工程。
https://x.com/trq212/status/2079103743535280508
https://x.com/trq212/status/2078901672441790818
Replit CEO Amjad Masad
Amjad Masad 从消费者支出结构解释为什么大型 consumer subscription software 很难出现。他指出,消费者主要把钱花在食物、房租、娱乐、手机与互联网、购物上,而软件通常是由公司购买的。因此除了 Netflix、Spotify 等少数娱乐类订阅,很难想到特别巨大的消费级订阅软件业务。这个观点对 AI consumer 产品尤其重要,因为很多 AI 应用试图直接向个人收取订阅费,但用户心智里的“软件预算”并不像企业采购那样自然存在。Amjad 的判断并不是说消费订阅不可能,而是提醒 builder 别轻易把企业软件的付费逻辑套到个人用户身上。对于 AI 产品定价,这意味着要么进入用户已有高频消费类别,要么证明价值足够强到能创造一个新的个人预算项。
https://x.com/amasad/status/2079086360703680583
Vercel CEO Guillermo Rauch
Guillermo Rauch 认为 cybersecurity 是衡量 superintelligence 的最佳 benchmark 之一。他把它称作软件工程里的“IQ test”,因为真正的安全工作包括发现漏洞、修补漏洞、逆向分析和利用漏洞,这些能力超越具体编程语言、runtime 和 framework。他认为,让模型一次性生成某个 XYZ clone 很容易在 X 上制造惊艳效果,但这不是好的测试。相比之下,安全任务要求模型具备真正的推理能力和“corner thinking”,也就是能在边界条件、异常路径和系统缝隙里思考。Guillermo 还说,他职业生涯中合作过的最优秀工程师通常都有很深的安全背景或兴趣。看到 Kimi K3 在这一类任务上表现良好,让他对 open models 更加乐观。
https://x.com/rauchg/status/2078912929714356698
Box CEO Aaron Levie
Aaron Levie 今天连续讨论了 open weights、AI 成本和应用层落地三个问题。第一,他认为当强大的开源替代品只落后 frontier models 一点点时,限制企业访问前沿模型能力会让自己更不安全、更不具竞争力。即使美国能完全禁止访问开源模型,其他生态不会有同样限制,它们既可以用这些模型提升防御,也可能用来对抗美国企业,因此 AI regulation 必须重新考虑 open weights models 已经比很多人预期更强这一事实。第二,他反驳了“AI 成本下降会导致 AI 支出下降”的直觉,认为通常会发生相反情况:AI 变便宜后,会被用于更多任务,比如写更多代码、做更多 bug 和安全 review、让 agent 处理过去无法处理的大数据集。由此,任何降低 token 成本的事情,在可预见未来都会推高 inference demand,这也解释了为什么 AI 的开源商业模式仍然成立,因为大多数人不是在本地设备跑模型,而是在基础设施上跑模型。第三,他强调 AI 扩散最终会受限于它和现实世界互动的速度,coding 之所以采用很快,是因为一个人坐在电脑前就能写、测、跑并产生价值;但生命科学、销售、合同、喷气涡轮叶片设计等领域都需要现实世界给反馈。Aaron 的结论是,模型输出本身在多数行业还不够,真正的机会在 applied AI layer:把智能嵌入现有工作流,并处理行业里的现实反馈循环。
https://x.com/levie/status/2078992778449850769
https://x.com/levie/status/2078968158006939716
https://x.com/levie/status/2078864191683969212
Builder Zara Zhang
Zara Zhang 提出了“代码和软件现在可以是 disposable”的观点。她举了三个会在使用后被丢弃的例子:为自己创建 design playground 或 modal 来微调设计观感,创建 HTML 页面帮助理解代码,临时搭一个 dashboard 只为了检查某件事一次。这个判断很适合当前 AI coding 工具环境,因为生成一次性软件的边际成本正在下降,软件不一定都要进入长期维护周期。她的另一条内容转向创作者定位:如果一个人刚开始做社交媒体,不知道该讲什么,就回想朋友、熟人、同事最常问自己的三个问题,把答案变成视频或帖子。她强调要像现实生活里回答别人那样表达,因为这本身就是定位;如果一个观点已经重复说过超过 3 次,就值得做成内容。Zara 还补充说,她最初开始发社交媒体的动机之一,就是厌倦了在线下反复回答同样的问题。
https://x.com/zarazhangrui/status/2078835308905578660
https://x.com/zarazhangrui/status/2078830510177128481
播客
The MAD Podcast with Matt Turck — Stripe's AI Chief: How AI Agents Will Buy, Sell, and Pay
核心要点:agentic commerce 不只是“让 AI 帮你买东西”,更大的变化是 agent 会成为经济行为者,能够发现服务、购买资源、出售产出,甚至以 micro firm 的方式运行一小段业务。
Emily Sense 是 Stripe 的 head of data and AI。她讨论的不是远期科幻,而是 Stripe 已经在搭建的 AI agent 经济基础设施:agent 如何发现商品,商家如何把 catalog、inventory、prices 暴露给 agent,消费者如何授权 agent 付款,以及 agent 如何安全执行交易。过去一年里,这个方向从假设变得更具体,Stripe 已经与 Google 合作,让商家可以在 AI mode 和 Gemini app 内销售;也在与 Microsoft、OpenAI 合作,帮助商家进入 Copilot 和 ChatGPT 的发现与购买路径;Meta 方向则是把 checkout 放进 ads。
她把 agentic commerce 描述成一个从低自治到高自治的谱系。低级别是人类仍然做主要决策,AI 只是帮助执行交易;中间形态是用户在 AI surface 里搜索“适合扁平足跑者的鞋”,AI 给出答案并附带 buy button;最高级别则是 agent 自主发现服务、决定购买并处理交易,中间没有人类实时介入。Emily 说,消费端目前大多还在 level two,用户愿意把部分选择交给 AI,但还没有进入“用 LLM 一次性订完整个暑假旅行”的阶段。
最具体的商业信号来自合作方名单。平台侧包括 Wix、Shopify、BigCommerce 和 Commerce Tools,品牌侧包括 Best Buy、Coach、URBN 和 Kate Spade。Emily 的判断是,如果 AI surface 已经成为大量用户发现产品的入口,商家就必须出现在那里,而不是只优化传统搜索、广告或站内电商路径。
风险层面,她特别强调 token theft。她说:“在 AI 里,骗子其实不一定要偷钱或凭证,偷 tokens 就够了。”更惊人的是,她看到的数据里,AI 公司超过六分之一的新注册都属于这种 abuse,类似“吃完就跑”,只不过偷的是 token。这个问题直接挑战了 AI 产品的计费、风控和用户 onboarding,因为滥用者瞄准的不是信用卡盗刷,而是推理资源本身。
定价方面,她认为 per seat pricing 正在失效。AI 的成本和价值并不总是按座席线性增长,企业需要更细的使用控制、ROI 判断和 guardrails。员工确实应该使用高 ROI 的 LLM,但公司也需要知道什么时候成本已经明显累积,以及这些成本是否有对应回报。
Emily 最后给出的 12 个月展望最有想象力:agent 不只是买家,而会成为多面向的经济参与者。它们会购买、销售、配置 infrastructure、组合服务并对外提供结果。她说,未来更有趣的不是“Emily 授权一个 agent 替她购买”,而是“Emily 有一个 agent,被分配去经营一门生意,其中包括买一些东西、卖一些东西,并赚取利润”。这对 builder 的启发是,agent 产品真正需要补的是旧有人类中心 commerce stack 没覆盖的部分:身份、授权、发现、结算、滥用防控和面向机器的商业协议。