X / 推特
AI builder Swyx
Swyx 仍在积极使用 `/loop` 和 `/goal`,并认为 AI 领域的多数使用者过早放弃了它们。他判断,在 g5.6/c5 阶段,这两种能力依然适合需要兼顾可引导性和自主性的任务。对于“生成循环的循环”这类开放目标,用户可以指定最终状态,而不必详细规定执行路径。他分享了一个很长的行动与推理任务,持续设置 goal 最终帮助他避免任务失控。另一个判断是,MITM agent distillation 虽然属于高难度技术,但这种方法确实有效。
https://x.com/swyx/status/2083439562437673053
https://x.com/swyx/status/2083237045720465504
OpenAI Codex 与 ChatGPT 团队 Thibault Sottiaux
Thibault Sottiaux 宣布重置 Codex 和 ChatGPT Work 的使用限制。他将此举描述为对一周效率成果的庆祝,并希望用户在周末运行更多任务。帖子给出的夸张目标是运行 100,000 个 Luna threads,重点显然是扩大高并发、长时间工作的试用空间。他随后特别确认,ChatGPT Work 也包含在本次调整中。对高频使用 Codex 和 ChatGPT Work 的团队而言,这意味着周末可以用更宽松的额度测试工作流。
https://x.com/thsottiaux/status/2083395449814229287
https://x.com/thsottiaux/status/2083387677945036995
Linear 产品负责人 Nan Yu
Nan Yu 表示,Linear 中最常见的自动化循环是 Issue、Agent、PR、Release,约 30% 的 bug 会完整走完这条流程。真正有效的指令应要求 agent 充分调查问题根因,并通过 Datadog 和 Sentry MCP 收集更多证据。只有在修复方案具有较高确定性时,agent 才应该动手改代码,否则很容易消耗大量 token 却得不到可靠结果。如果缺少复现步骤等关键信息,agent 应直接在 issue 中留言,请报告者补充证据。他的核心判断是,agent 与人一样,需要被明确要求遵循良好的工程实践。
https://x.com/thenanyu/status/2083230295206121807
Replit CEO Amjad Masad
Amjad Masad 分享了一个约 1,500 Elo 的 8b 模型。按他的测试结果,该模型能够持续击败前沿模型和 Stockfish level 0。即使 GPT 5.6 启用了高强度推理与 response chaining,这个 8b 模型仍能胜出。速度差异也很明显,它每步只需要 1 至 2 秒,而对照模型需要约 30 秒。他同时提供了可直接试玩的入口,强调小模型在特定任务上可能同时取得速度和效果优势。
https://x.com/amasad/status/2083424608993300824
Vercel CEO Guillermo Rauch
Guillermo Rauch 将 AI Gateway 定位为企业把 AI 转化为有效投资所需的关键基础设施。新增能力包括按 key、团队或项目设置预算,以更细粒度控制成本。平台还提供故障切换、模型与供应商选择,以及实时可观测性。他认为企业应走出单纯追求最大 token 消耗的阶段,开始关注可靠性、治理和投入产出。随着软件项目转向 agentic software factories,Issue、Agent、PR、Release 的闭环会成为常态。作者和维护者的工作重点也将转向优化这条循环、提高产品质量,并定义哪些任务值得进入循环。
https://x.com/rauchg/status/2083319868766699699
https://x.com/rauchg/status/2083208578526314513
Box CEO Aaron Levie
Aaron Levie 判断,harness 将成为 AI 技术栈中仅次于模型能力的关键变量。他没有断言某组具体数字能推广到所有任务,但认为整体趋势已经明确。高质量 harness 需要高效拆分工作,并在正确时间把任务路由给正确模型。这会直接影响准确率和成本,而不只是使用体验。当任务规模从数十万或数百万 token 上升到数千万乃至数亿 token 时,harness 的影响会显著放大。他认为这一领域仍处于非常早期,存在巨大的产品和基础设施机会。
https://x.com/levie/status/2083389460679373135
Y Combinator CEO Garry Tan
Garry Tan 认为,无论是个人 AI 还是企业知识大脑,都需要一个结构清晰的 harness。他推荐的方案由自己的团队构建,并且团队每天都在实际使用。该项目免费且开源,其他个人和组织可以直接获取。Garry 将 harness 视为个人智能工具和公司级 AI 系统共用的基础层。帖子强调的是团队日常使用与开放获取,没有进一步宣称具体性能指标。
https://x.com/garrytan/status/2083353760701833546
Builder Zara Zhang
Zara Zhang 发现,自己每次发布病毒式传播的内容前,都要对抗“这不是显而易见吗”的自我怀疑。她的结论是,对创作者显而易见的经验,在大多数时候并不为大多数人所知。她还关注 Claude Tag 对 Anthropic 工作方式的改变,并引用数据称,Anthropic 产品与工程团队现在有 65% 的 PR 由 Claude Tag 发起。对于非工程团队,她认为最自然的 agent 界面就是员工已经使用的 Slack 等协作工具。她自己的工作入口在半年内从 1 月的终端,转向 3 月的 Codex 等桌面应用,再到 6 月的工作协作工具。每次迁移都让 agent 更接近人类原本的沟通方式。她的判断是,agent 应该直接出现在用户工作的地方。
https://x.com/zarazhangrui/status/2083354965482062079
https://x.com/zarazhangrui/status/2083161173563003268
FPV Ventures 合伙人 Nikunj Kothari
Nikunj Kothari 提到,风险投资行业中存在一种不常公开讨论的信念,即最优秀的创始人往往在逃离某些东西。这种驱动力可能来自不安的童年、强烈的证明欲,或持续让人踩住油门的痛苦。他的新文章试图追问,创业者真正的动力究竟来自哪里。文章还讨论了一种多数人从未进入过的更高强度状态。他没有把这种信念直接当成普遍结论,而是将其作为理解创始人动力与极端投入程度的问题。
https://x.com/nikunj/status/2083307235619287363
OpenClaw 与 OpenAI builder Peter Steinberger
Peter Steinberger 表示,过去处理并发输入时,queue 是更合适的方式。到了 5.5,模型已经不再容易因为新增输入而混乱。用户可以在模型工作过程中继续把任务交给它,而不必等待当前工作结束。模型会依次、认真地处理过程中收到的内容。这个变化让工作方式从显式维护任务队列,转向在执行过程中持续追加和引导任务。
https://x.com/steipete/status/2083369880599015713
Every CEO Dan Shipper
Dan Shipper 表示,自初春以来,OpenAI 相对 Anthropic 的势头变化已经相当明显。他将这一变化称为一个引人关注的 comeback story,并在一篇讨论 OpenAI 与 Anthropic 的《华尔街日报》文章中重申了判断。他还用一组虚构的 2027 年程序员面试题,讽刺 AI 可能如何改变工程师的能力门槛。问题包括最近解决的三个未决数学猜想及其 prompts,以及 agent 最近一次无意实施的网络重罪和缓解措施。最后一个问题重新拿“strawberry 中有几个 R”与“seventeen 中有几个 e”测试候选人,把前沿能力与基础文字判断并置。他描绘的未来是,人类程序员不仅要展示结果,还要解释如何指挥 agent,以及如何处理 agent 带来的风险。
https://x.com/danshipper/status/2083380721607921904
https://x.com/danshipper/status/2083239700664349128
AI builder Sam Altman
Sam Altman 分享了一个 ChatGPT Work 的家庭使用案例。用户可以连接家庭成员的日历,并向系统说明孩子们各自的兴趣。系统每天早晨为上学路程生成一段个性化播客。内容可以同时覆盖某个孩子当天的足球比赛、另一个孩子即将到来的生日,以及部分新闻。这个案例把日历、家庭背景和固定通勤时间组合成持续生成的音频内容。他还用“20x”回应 Moore’s law 的比较,但没有在帖子中展开计算口径或具体背景。
https://x.com/sama/status/2083221585792762171
https://x.com/sama/status/2083203642975502640
官方博客
Claude Code now supports artifacts
Claude Code 现已支持把工作进度生成为 artifact,即会随 session 推进而更新的可视化网页。它可以用于 PR walkthrough、系统说明、可筛选 dashboard、发布检查表和事故调查页面。artifact 会利用 session 的完整上下文,包括代码库、connectors 和对话,不要求用户重新连接数据源或搭建额外基础设施。页面更新后会在同一 URL 原位刷新,每次发布都会生成可恢复的版本记录,团队也可以通过 gallery 管理已有 artifacts。Anthropic 在内部测试中常用它呈现事故时间线、可疑 commits、错误率变化和根因分析,让团队成员直接共享同一个持续更新的调查视图。artifact 默认仅作者可见,分享范围限于经过身份验证的组织成员,不能公开发布。管理员可以通过组织级开关、角色范围、保留策略和 compliance API 管理访问。该功能目前以 beta 形式向 Claude Team 与 Enterprise 组织开放,可从 Claude Code CLI 和桌面应用创建,并在浏览器中查看。
https://claude.com/blog/artifacts-in-claude-code
播客
Unsupervised Learning — Ep 92: xAI Co-Founder Unpacks the Future of Model Development
核心要点:coding agent 的突破只是起点,真正重要的下一步,是让 AI 从可验证的软件任务走向科学发现和个人生活,同时把控制权与收益分散给更多人。
Igor Babushkin 曾在 DeepMind 负责 StarCraft 和 AlphaCode 相关工作,在 OpenAI 参与早期 reasoning 研究,随后成为 xAI 联合创始人,并参与 Colossus 与模型研发。他离开 xAI 后创办 River AI,关注面向企业和消费者的个人 AI,以及本地硬件。其出发点不是简单复制“大规模预训练、提供 API、按 token 收费”的既有模式,而是探索新的模型构建、定制与分发方式。
第一个关键判断是,coding agent 在去年 11 月至 12 月跨过了一个无法忽视的能力门槛。Babushkin 回忆,最新一代 Claude Opus 模型让软件工程师和 AI 研究者普遍承认 agent 已经能显著降低开发难度。他自己在 12 月用 coding agent 重写了许多过去做过或一直想做的项目,同时感受到能力快速增长可能带来的失控风险。他用一句话概括这种处境:“我们所有人都正在变成魔法师的学徒。”工具带来近似魔法的生产力,但使用者未必始终能够控制后续影响。
第二个判断是,coding 与数学率先突破,并非因为 agent 只能用于这些领域,而是因为结果容易验证。代码可以运行测试,数学定理与证明可以借助 Lean 等工具形式化,从而提供明确的 reward signal。科学发现是自然延伸方向,但材料科学、基础物理和火箭发动机等问题必须回到现实世界运行实验。agent 提出材料设计后,需要获得实验是否成功的反馈,因此如何闭合现实环境中的数据循环,是当前的重要瓶颈。
第三个判断是,最高能力模型和个人 AI 可能走向不同分支。用于复杂编码、数学和科研的模型可以继续追求极限能力,但改善普通人生活的 agent 不一定需要证明黎曼猜想。个人 AI 更需要理解用户在生活、工作和外部世界中的具体处境,并基于这些信息采取行动。Babushkin 认为,让个人切实获得 AI 的价值并掌控其行为,是 River AI 的核心动机。
第四个判断涉及 AI 安全与权力集中。Babushkin 在 2025 年离开 xAI 后投资了一些 AI safety 公司,但等待其他团队推进让他感到不耐烦,于是决定亲自创业。他把分散 AI 收益和控制权视为当下最紧迫的安全问题,因为模型访问与行为规则越来越由少数大型公司决定。他也支持开放接近危险能力阈值、但尚不足以造成现实伤害的模型,让更多研究者参与 alignment、控制算法和网络安全研究。相比遥远且难以预测的模型接管风险,他认为更直接的问题是 AI 是否会放大不平等,以及能否让更多人共同获得进步带来的收益。