X / 推特
Anthropic Claude Code 成员 Boris Cherny
Boris 用 Opus 5.5 配合 Lean,对 Claude Agent SDK 做了形式化验证,几个简短提示就带来了 16 个修复不同 bug 和竞态条件的 PR。他表示,TLA+ 也很适合这类工作,自己有时会结合 Lean 与 TLA+,排查数据流、并发和状态管理问题。虽然他对这两种语言都不熟悉,但 Claude 的表现让他能够通过形式化建模,寻找人工检查可能遗漏的缺陷。他由此提出一个问题:形式化验证是否会成为编程,至少是查找 bug 的未来方向?在另一项测试中,团队分别让 Opus 5.5 和 Fable 5.1 将 HAProxy 从 C 移植到 Rust,两者都通过了几乎全部 HAProxy 测试。Opus 5.5 用时 9.5 小时,Fable 5.1 用时 12 小时,前者成本还低了 51%。Boris 表示,过去几周 Opus 5.5 已经是他的日常主力模型。
https://x.com/bcherny/status/2102543349102338309
https://x.com/bcherny/status/2102439069053747549
OpenAI Codex 与 ChatGPT 成员 Thibault Sottiaux
Thibault 宣布 GPT-6 Sol 和 Luna 已发布,并称两个模型的整体能力都有显著提升。他特别提到写作能力,以及需要实际使用才能感受到的综合体验改善。与此同时,两者的 API 价格将永久降低 50%,让更多使用场景在成本上变得可行。他表示,效率提升也会让订阅用户的额度更经用。OpenAI 还将为 Plus、Pro 和 Business 用户的所有账户提供一次可留待使用的额度重置。他将团队的方向概括为同时提升效率与智能,并强调,顶端模型的能力可以进一步用于改善其他层级的产品。
https://x.com/thsottiaux/status/2102463847714247142
https://x.com/thsottiaux/status/2102440619616682120
Anthropic Claude Code 与 Cowork 成员 Cat Wu
Cat 宣布,面向 Pro、Max 和 Team 套餐,Opus 5.5 已成为 Claude Code 和 Claude 应用的默认模型,其中也包括 Cowork。她已将其作为日常主力模型,尤其认可它清晰的表达能力,以及按照自己风格写作的能力。各产品默认采用 medium 推理强度,她表示,这一设置下的智能水平与 Fable 5.1 相当,但速度更快。与 Opus 5 相比,使用 Opus 5.5 时,同样的使用限额可以多支撑 25% 的用量。这次调整同时涉及默认模型、推理强度和额度效率,直接影响订阅用户的日常使用体验。Cat 鼓励用户交给 Opus 5.5 更有挑战性的任务,再反馈实际表现。
https://x.com/_catwu/status/2102437713781944397
Anthropic Claude Code 成员 Thariq
Thariq 认为,模型能力提升后的正确用法,不是向生产环境交付 10 倍数量的功能。他主张把更多时间用于理解用户、开展实验和制作原型,也用于学习自己尚未理解的领域。这些投入的目标,是让最终交付的东西真正有效,而不是只增加功能数量。在具体使用上,工作流已经成为他使用 Claude 的重要组成部分。他看重的新变化,是接近 Fable 水平的智能如今在成本上更适合用于工作流。两条观点共同指向一个关注点:模型进步的价值,需要通过更充分的探索和可负担的实际使用来兑现。
https://x.com/trq212/status/2102548686303854790
https://x.com/trq212/status/2102477527688388752
Vercel CEO Guillermo Rauch
Guillermo 提出,软件可以通过用户自行生成和部署的方式延续生命,并以 Google Reader 为例说明:喜欢某个产品,就可以构建属于自己的版本。他还公布了一轮新的 Next.js 评测,Opus 5.5、GPT 6 Sol 和 Fable 5.1 的成绩均为 97%,Grok 4.7 为 94%。除了得分,他特别指出 Grok 的成本便宜 2 至 7 倍,让价格成为这组结果中值得同时考虑的因素。在设计层面,他赞赏 Anthropic 发布产品时体现出的审美。他解释,自己当初对网页的 headless 架构感兴趣,就是因为页面可以拥有各种独特、富有想象力的形态。在他看来,AI 进一步降低了实现这些设计的门槛,开发者应当继续探索网页设计的边界。
https://x.com/rauchg/status/2102594015669756323
https://x.com/rauchg/status/2102519097770885231
https://x.com/rauchg/status/2102438365455167883
Anthropic 研究成员 Alex Albert
Alex 分享了使用 Opus 5.5 和 Blender 重建历史街景的尝试,目标是还原 1906 年地震前的 San Francisco Market Street。他给 Claude Tag 的提示将时间精确到 1906 年 4 月 17 日下午,范围从 Ferry Building 沿 Market Street 延伸到 Fifth Street,并指定 Palace Hotel、Call Building 等地标。在开始建模前,模型需要先依据 1899 至 1905 年的 Sanborn 火灾保险地图、Miles Brothers 的街景影片、历史照片和 USGS 地形资料建立来源文件。每栋建筑都要记录占地轮廓、高度、立面材料、使用者,以及各项事实的来源和置信度。建模必须全部使用 Blender Python,不得下载现成网格、纹理或 HDRI。提示还要求编写可复用的建筑立面、屋顶、窗户、路灯及交通工具生成器,再依据来源文件组装街道,确保建筑能够追溯到数据。最终交付要求包括一段沿街行进的 10 秒视频,Alex 则将这一尝试归功于 Opus 5.5 更好的三维建模与视觉能力。
https://x.com/alexalbert__/status/2102466524934271381
https://x.com/alexalbert__/status/2102466523164274839
Box CEO Aaron Levie
Aaron 将 Opus 5.5 降价和 GPT-6 Sol、Luna 的 token 价格下降 50% 联系起来,认为单位任务成本下降会显著扩大 agent 的可用场景,这是杰文斯悖论在 agent 上的体现。他列举的方向包括处理企业数据、扫描代码安全问题、分析日志,以及在工作流中使用多个 agent。Box 使用 Box Agent 测试复杂的非结构化数据任务后报告,相比 Opus 5,Opus 5.5 的 token 用量减少 63%、冗长程度降低 42%、速度提升 30%。在金融尽调测试中,任务准确率提升 39%,模型每次都找出了收购目标定价工具中的全部计算错误,总 token 用量减少 82%。在云成本分析中,任务准确率提升 65%,模型正确选择了留存计算依据并保持单位一致,用时减半,token 用量减少 70%。在客户账户分析中,任务准确率提升 17%,模型从 18 人名单推导合同未注明的资历构成,并按每位客户的回答计算平均满意度,而非被单项满分误导。在疟疾快速检测数据分析中,任务准确率提升 15%,模型发现两组标准差相差超过 100 倍,重新分析后判断旱季差异并不成立。Aaron 表示,客户很快就能在 Box AI Studio 中使用 Opus 5.5 构建 AI Agents。
https://x.com/levie/status/2102477253070430322
https://x.com/levie/status/2102448415775051790
Y Combinator CEO Garry Tan
Garry 分享了使用 Capy 的体验,称它让自己提交 PR 的速度显著快于单独使用 Codex 或 Claude Code。他给出的是个人使用感受,没有提供具体提速比例或评测数据。在另一条推文中,他主张教会更多人编写提示,并充分使用 AI。他希望人们看到 AI 如何帮助自己推进不同领域的追求。与工具使用相配套的,是更主动地寻找和解决问题,既解决自己的问题,也帮助他人。
https://x.com/garrytan/status/2102544711647129902
https://x.com/garrytan/status/2102501556348440983
FPV Ventures 合伙人 Nikunj Kothari
Nikunj 提醒读者,对大额融资新闻的标题保持审慎,因为即使是顶尖投资者,也在组织数量惊人的 SPV,即特殊目的投资载体。他认为,一些看起来由大型基金支持的融资,实际上有相当一部分资金来自 SPV,而标题未必呈现这种结构。再加上分批设置的估值,以及营收口径并不一致,公开报道很难完整反映公司的真实情况。他的核心判断是,真正能够验证表现的证据,并不都能从公开信息中获得。他还发布了与 Todd Saunders 的《A Walk In The Park》第三部分,议题包括从 Google 转向地板行业软件、标为“1000 万美元转型”的经历,以及退出后的生活。讨论目录还涵盖垂直软件与通用软件、联合创始人,以及为什么再次募集风险投资,视频在 New Jersey 的 Westfield 使用 iPhone 拍摄、Descript 剪辑。
https://x.com/nikunj/status/2102534909076349291
https://x.com/nikunj/status/2102395699895677325
OpenClaw 与 OpenAI 成员 Peter Steinberger
Peter 分享了一次从应用崩溃追查底层缺陷的经历。他升级到 macOS 27 后,遇到了 ChatGPT 偶尔崩溃的问题。随后,Astra 找到了 libuv 中一个存在约 14 年的 bug。这条更新给出了具体的系统版本、排查工具和缺陷所在组件。不过,素材没有说明 bug 的技术成因,也没有交代修复是否已经合并或发布。
https://x.com/steipete/status/2102501642176528743
SPC 普通合伙人、Bevel Health 联合创始人 Aditya Agarwal
Aditya 将当下围绕模型安全与对齐的讨论,放回自动驾驶的发展背景中,指出 AI 与机器学习早期的重要安全争论就发生在这一领域。他回忆,第一次乘坐 Waymo 时,最震撼的是技术竟然能够应对真实道路上的各种复杂情况。在 SPC 与 Dmitri Dolgov 的交流中,他最关注的是 Waymo 为建立发布信心而搭建的大规模评测和测试基础设施。这套基础设施服务于一个非常具体的任务:让重达 2 吨的机器人以每小时 30 英里的速度穿行城市环境。他已主持超过 50 场 Minus One 炉边谈话,而与 Waymo 的这场交流,是他 9 岁孩子第一次主动要求参加的活动,让他感受到面向物理世界创造产品的吸引力。对于 AI 产品本身,他还提醒开发者,不要在追求生产力的过程中忘记愉悦感和趣味性,并以自己使用 Sentience 时的体验为例。
https://x.com/adityaag/status/2102498288658526614