X / 推特
OpenAI Codex 与 ChatGPT 团队 Thibault Sottiaux
他在公开向用户征集 Codex 的短板,原话是"有什么让你觉得意外的、Codex 至今仍做不好、而我们早就该做对的事情"。由核心团队成员直接下场收集产品差距,通常意味着团队正在为下一轮迭代排优先级,想给 Codex 提需求的读者现在是好时机。他还分享了一段和 Sol 的搞笑互动:他连发几十个敬礼 emoji,模型一本正经地做乘法和减法,最后算出"负 332 个敬礼",并解释成"你欠下了 332 个敬礼的债"。他自己评价这段互动"很傻,但把我逗笑了"。两条放在一起看,他最近的关注点是 Codex 的能力边界,以及模型在荒诞输入下的行为表现。
https://x.com/thsottiaux/status/2073551549494596079
https://x.com/thsottiaux/status/2073554978053005607
Linear 产品负责人 Nan Yu
他给出了一个关于 AI 时代抓 bug 的明确观点:抓 bug 最好的方式是亲手用产品、试着把它玩坏,而不是靠盯着代码"推算"哪里会出问题。他认为大多数 bug 不会在代码审查里被发现,code review 真正的价值是把关架构和 API 设计,控制技术债的增长速度。对正在用 AI 大量生成代码的团队,这是一个实用的分工框架:人负责产品级的破坏性测试,审查聚焦在结构层面。他还调侃说自己当年手写代码进入心流时会不停爆粗口,所以看到 AI 编码时的类似表现,"这基本上就是 AGI 了"。另一条玩笑戳中了 AI 代码事故的责任问题:如果生产环境的数据表全被删了,被开除的是模型还是你。整体看,他在持续输出"AI 写代码的时代,人的价值在测试和架构判断"这条主线。
https://x.com/thenanyu/status/2073410299680428445
https://x.com/thenanyu/status/2073412466436878666
https://x.com/thenanyu/status/2073410944969932877
Anthropic Claude Code 团队 Cat Wu
她分享了 Claude Fable 5 的一个工作细节:她做用户留存分析时,模型没等她提要求,就主动用了倾向得分匹配(propensity score matching,按活跃度匹配用户,保证对比的是同类人群)。这是一种防止选择偏差的标准统计手段,通常需要分析者自己想到才会用上。她认为这体现了 Fable 5 判断力的整体提升,不只在数据分析,从在 Cowork 里写邮件和文档,到在 Claude Code 里调试复杂报错,都能感觉到。对做数据工作的用户来说,这意味着模型开始自带方法论,会在你没意识到偏差风险时主动上更严谨的做法。
https://x.com/_catwu/status/2073439890482794966
Vercel CEO Guillermo Rauch
他把 Vercel AI Gateway 的历史 token 消耗做成了一个动态的"花钱竞赛"动画,数据聚合自每月数百万开发者、数万亿 token 的真实用量。他点出三个看点:各大实验室之间的排名此起彼伏、Anthropic 的持续领先,以及开放权重模型的崛起。因为 AI Gateway 是大量开发者调用各家模型的统一入口,这份数据可以看作开发者用脚投票的横截面,比基准测试分数更接近生产环境里的真实偏好。想判断各家模型实际市场份额走势的读者,值得点开看一眼。
https://x.com/rauchg/status/2073563586270781674
Y Combinator CEO Garry Tan
他借旧金山的住房争论再次重申供给侧立场:SF 需要尽快建房,政策应该激励和扩大供给,而不是继续补贴需求。他公开力挺市长 Lurie 的 YIMBY 家庭分区规划,并猛烈批评阻挠建房的 NIMBY 阵营,称对方"想摧毁住房和就业、让城市更不安全",而自己这边"想建房、想让城市更安全"。他的框架很简单:住房是供给问题,任何不增加供给的方案都是拖延。对关注 SF 科技生态的读者,这也是这位 YC 掌门人持续为旧金山"boom loop"(繁荣循环)站台的一部分。
https://x.com/garrytan/status/2073575065917280331
https://x.com/garrytan/status/2073558419412500564
https://x.com/garrytan/status/2073558154873593926
OpenClaw 作者 Peter Steinberger
他预告了自己工具的下一个版本将显示各档用量重置(resets)的确切到期时间,方便用户玩他所谓的 valuemaxxing,也就是在配额周期内把订阅价值榨到最满。对重度使用 Claude、Codex 这类按周期限额计费产品的用户,这种可视化能直接改变你安排大任务的时间点:知道额度什么时候刷新,就能把最烧 token 的活排在周期开头。结合他 OpenClaw 的背景,他的主线仍是围绕 agent 工具链做效率周边。
https://x.com/steipete/status/2073482942513565713
官方博客
Claude Blog — Building intelligent apps for Apple platforms with Claude in the Foundation Models framework
Anthropic 发布了一个新的 Swift package,让 Apple 开发者通过 Apple 的 Foundation Models framework 直接调用 Claude。原框架让开发者用三行代码就能调用 Apple 端上模型并拿到类型化的 Swift 返回值,适合摘要、信息抽取这类快速本地任务;现在当请求需要多步推理、代码生成、联网搜索或执行代码做数据分析时,可以把任务交给 Claude,响应流式写回同一个 SwiftUI 视图。关键设计是 @Generable 注解返回类型化 Swift 值,请求到达 Claude API 时输入已经是干净的结构化数据,而不是原始用户文本。官方举的例子:日记应用在端上生成每日提示,再让 Claude 串联数月日记找出主题脉络;学习应用在端上解释名词,学生追问"这对我们学过的其他内容为什么重要"时切给 Claude。官方的说法是"一个体验,每一步都由最合适的模型支撑"。支持 iOS 27、iPadOS 27、macOS 27、visionOS 27 和 watchOS 27,加入 package、登录 Anthropic API key 即可,流式、tool call 和结构化返回都由 package 处理。
https://claude.com/blog/claude-for-foundation-models
播客
The MAD Podcast with Matt Turck — Cloudflare CEO: The Internet's Business Model Is Dead
核心要点:2026 年上半年,互联网上的 bot 流量历史上第一次超过了人类流量,而互联网近 28 年赖以生存的广告商业模式对 bot 完全失效,未来五年整个互联网的商业模式将被迫重写。
对话嘉宾是 Matthew Prince,Cloudflare 联合创始人兼 CEO。Cloudflare 坐在全球相当大比例的互联网流量前面,radar.cloudflare.com 的数据让他对全网趋势有几乎无人能及的视角。这个话题现在值得关注,是因为变化的速度远超所有人预期:2025 年秋他的团队预测 bot 流量要到 2027 年底才会超过人类,2026 年 3 月修正到 2027 年上半年,结果 2026 年上半年就发生了。
几个信息密度最高的点。第一,驱动力是 agent:人自己买相机可能逛 5 个网站,agent 会替你逛 5000 个。Prince 判断五年内 bot 流量可能达到人类流量的 1000 倍,基础设施需求会让 COVID 期间两周流量翻倍"显得微不足道"。第二,商业模式的出路是微支付。Cloudflare 每秒处理约 5 亿个请求,估算其中相当比例可以通过微支付变现,这意味着第一天就要支撑每秒 1000 万笔金融交易,并要能爬到每秒 1 亿笔,而全球最大的支付网络 Visa 每秒不到 10 万笔。他们正联合 Coinbase、Stripe 和 x402 协议(启用 HTTP 402 Payment Required 这个从未被真正用起来的状态码)来做这件事。控制权已经在起效:拿到访问控制工具后,Conde Nast、Dotdash Meredith 这类大出版商跟 AI 公司签下了明显更好的协议。第三,内部 AI 化的样本。Cloudflare 93% 的研发人员在用 AI 编码工具,转折点是团队里最资深的怀疑派、Workers 平台作者 Kenton Varda 花一个月试图证明这些工具是垃圾,回来宣布自己生产力提升了 100 倍。第四,组织层面他裁掉了超过 20% 的员工,不是因为业务困难,而是中层管理和"测量型"岗位被 AI 取代,管理跨度从平均 6 人拉到 12 人(他认为 Meta 追求的 50 比 1 太激进)。他给出了业内最慷慨的遣散方案,股票继续 vest,并预测未来 6 到 12 个月几乎每家公司都要经历同样的裁员。他最扎人的一句话:"很多 CEO 在观望,因为怕自己先动手难看。恕我直言,这是怂,因为你能对团队做的最残忍的事,就是等待。"第五,安全侧的预警:模型找漏洞的能力已经强到他预计未来两年"每周都会出一个 Log4j 级别的漏洞",但这是个假动作,两年后软件质量会因为 AI 审查大幅变好,Cloudflare 内部已经有一个用十年事故数据训练的 agent 审查每次代码发布和每个配置变更,上线后小事故数量断崖式下跌。
他对内容生态的 framing 值得记住:LLM 是人类知识的数学模型,像一块瑞士奶酪,AI 公司愿意付钱的是能填上奶酪孔洞的净新知识,而不是第 N 篇同题报道。Spotify 去年给音乐创作者分了约 120 亿美元,丹麦有位创作者靠专写"未被满足的搜索请求"的歌一年赚约 4000 万欧元;他自己在 Park City 买下的本地报纸,今年 AI 授权收入预计将超过展示广告。流量时代奖励的是激怒你的标题,微支付时代如果能奖励填补知识空白的人,互联网反而可能变得更健康。