X / 推特
OpenAI Codex 与 ChatGPT 团队 Thibault Sottiaux
OpenAI 本周集中推出了 Images 2.5、GPT-Live-1、Agents API、Data Agent 和 ChatGPT for Financial Services,而且下一周仍有更多发布计划。Astra 团队同时处理了一批用户反馈的质量问题,包括旧模型技能触发过于频繁,以及部分技能阻碍模型检查自身工作。一个可能导致任务提前停止或错误回应旧消息的可选上下文管理实验已被关闭,团队粗略估计约有 4,000 至 5,000 名用户受到影响。部分配置不当、造成长尾流量质量下降的引擎也已移除,改进目标是让任务跟进、最新消息追踪和过程检查更加稳定。OpenAI 还吸纳了 Git AI 团队的 Aidan 与 Sasha,计划继续开源并投入这款用于分析 coding agent 如何贡献代码库的工具,帮助企业衡量 Codex 对个人和团队工作的实际价值。
https://x.com/thsottiaux/status/2098639827084480864
https://x.com/thsottiaux/status/2098612714704891959
https://x.com/thsottiaux/status/2098569976143806918
AI 教程创作者 Peter Yang
Peter Yang 将自动化任务按运行环境进行了明确拆分,本地 scheduled tasks 全部放在 Codex,云端任务则逐步迁移到 Grok Bot。他认为这种划分能减少工具边界的混乱,让任务归属更清晰。与此同时,他对“software factories”概念持怀疑态度,认为当前 AI 除了验证和测试之外,还无法在没有人类参与的情况下持续改进产品或端到端开发新功能。实际运行 overnight agent 时,只要模型在早期做出一个错误假设,后续工作就可能整体偏离目标并浪费大量 token。他因此追问,市场上究竟有哪些产品或功能真正由 software factory 完成,且全程没有人类定义需求或检查结果。
https://x.com/petergyang/status/2098614492066435228
https://x.com/petergyang/status/2098565668241334366
Meta AI 高级总监 Madhu Guru
Madhu Guru 将企业 AI 项目失败归结为三个常见问题。第一,企业沿用过去十五年渐进式产品开发的组织方式,由 CEO 指定亲信组建中央 AI 团队,却忽视 AI 产品需要实验、发明以及不同的团队能力。第二,企业低估 evals 的重要性,没有把评测体系作为产品开发的一等组成部分。第三,中央团队从业务外围建设统一平台,产品与财务、销售或客服人员的真实流程、上下文和判断脱节,最终只能换来勉强采用,而非显著生产力提升。他建议聘用真正成功构建过 AI 产品、同时能赢得业务人员信任的负责人,并把最优秀的 AI builder 直接嵌入待改造职能,与使用者共同建设解决方案。
https://x.com/realmadhuguru/status/2098448235048378456
Anthropic Claude Code 团队 Thariq
Claude Code 推出了 plugin evals,用来检查技能在新模型发布后是否仍然正常工作。开发者可以进入插件目录运行 `claude plugin eval init`,为插件初始化评测。Thariq 同时提醒,只看 pass 或 fail 分数,已经很难正确解释今天的模型评测结果。他观察到不少 benchmark 失败来自过度严格的 hidden tests,而不是模型答案本身缺乏合理性。在一些案例中,模型给出的答案甚至比预设的 expected result 更符合问题,因此评测需要结合失败样本和判定标准,而不能只追逐汇总分数。
https://x.com/trq212/status/2098531560643539440
https://x.com/trq212/status/2098490139798655427
Replit CEO Amjad Masad
Replit 收购了一家完全依靠 Replit 构建的企业。Amjad Masad 将其视为此类交易的开端,并预计未来还会出现更多相似案例。这件事展示了平台从开发工具向创业基础设施延伸后形成的闭环,即公司可以在 Replit 上完成建设、运营和商业化,最终成为 Replit 的收购对象。他也注意到用户正在 Replit 上开展大量 Astra 3D 实验,说明新的模型能力正迅速进入实际创作环境。两条动态共同指向 Replit 的平台定位,既承载 AI 原生产品实验,也可能参与这些产品后续的商业整合。
https://x.com/amasad/status/2098548464452055437
https://x.com/amasad/status/2098316298820219058
Vercel CEO Guillermo Rauch
Tailscale 的 model router 采用 Vercel AI Gateway 作为底层基础设施。Guillermo Rauch 将 AI Gateway 类比为新一代 CDN,强调它正在成为模型流量与应用之间的通用基础层。应用虽然可以直接连接模型提供商,但这种 direct to origin 方式容易受到接口、可靠性和供应商差异影响。团队也可以自行搭建网关,不过开发、维护和成本控制都更加繁琐。Vercel 的判断是,随着多模型调用成为常态,统一路由和基础设施抽象会像 CDN 一样逐渐成为默认配置。
https://x.com/rauchg/status/2098531157230969062
Box CEO Aaron Levie
Box 现在可以挂载到 agent sandbox,让 agent 更方便地读取和写入其计算机中的文件。这个能力把企业内容系统直接接入 agent 的执行环境,而不只停留在问答或检索层。Aaron Levie 认为,随着 AI agent 开始执行关键企业流程,它们需要获得人类员工长期依赖的同类基础能力。文件访问正是其中一个核心 primitive,因为大量业务动作最终都涉及读取资料、生成内容和保存结果。Box 的这一集成因此瞄准了 agent 从理解企业内容走向直接操作企业内容的过渡。
https://x.com/levie/status/2098478938003841123
软件产品设计师 Ryo Lu
Cursor 已经上线面向大型创意项目的 long-lived agents。与一次性完成短任务的 agent 相比,这类 agent 更强调跨越较长时间持续推进复杂目标。它们适合需要多轮执行、上下文延续和阶段性调整的软件建设工作。Ryo Lu 将其定位为服务“大想法”的能力,体现 Cursor 正在把 agent 从代码补全和即时修改扩展到长期项目协作。真正的产品考验将是 agent 能否在长时间运行中稳定保留目标、处理变化,并让用户持续掌握执行状态。
https://x.com/ryolu_/status/2098324260867772806
Builder Zara Zhang
Zara Zhang 认为“一人公司”的概念被高估了。AI 的确让单个人可以完成更多工作,但创造新产品仍然可能是一段极其孤独的经历。创业者不仅需要执行能力,也需要可以共同讨论、共同承受挫折和共同庆祝进展的伙伴。当一个人没有与其他人形成长期承诺时,失去动力会非常容易。她的判断提醒 AI builder,生产力提升并没有消除团队的情感支持、互相校准和共同坚持所带来的价值。
https://x.com/zarazhangrui/status/2098483800456179923
FPV Ventures 合伙人 Nikunj Kothari
Nikunj Kothari 观察到,成功项目的归因在风险投资行业中经常引发争夺。大型退出或估值显著上涨本就稀少,而这些案例又是 VC 募集下一只基金时最重要的 track record,因此成功项目的署名具有直接利益。未来几年,一些人的名字可能从项目历史中被删除或被选择性忽略,同时更多人会尝试重新叙述历史并认领功劳。emerging GP 面临的问题尤其明显,因为他们向未来 LP 展示的关键资产正是过往投资记录,却未必能获得实际应得的认可。他建议这些投资人维护好与创始人的关系,因为创始人最终可能成为最可信的 reference check。
https://x.com/nikunj/status/2098550718923997430
OpenClaw 与 OpenAI Builder Peter Steinberger
Peter Steinberger 展示了 Astra 在 OpenClaw 云端 session 中通过 CUA 玩 Doom 的实验。这个演示把模型、长期运行环境和计算机操作能力组合到一个可观察任务中。模型需要持续理解游戏画面,并通过界面操作做出下一步行动,因此比单轮文本生成更接近实时 agent 测试。他明确表示这还不是 AGI,但用“可能胜过苍蝇的大脑”形容当前表现。实验的价值不在于游戏成绩本身,而在于展示通用模型如何借助 CUA 在动态视觉环境中连续行动。
https://x.com/steipete/status/2098527519213604889
Every CEO Dan Shipper
Dan Shipper 认为,更高的 benchmark 分数无法充分说明模型在用户真实工作中的表现。Every 过去三年一直通过 hands-on testing 撰写新模型的长篇 vibe checks,直接观察模型处理团队实际任务的能力。现在团队正在把这种主要依赖体验判断的方法进一步量化,建立内部平台,让每个人都能根据自己的日常工作创建 personal benchmarks。这个方向保留了真实任务的相关性,同时为跨模型和跨版本比较增加更稳定的检查依据。Every 也在招募能够接触最新模型、工具和团队的写作者,显示模型评测与深度内容仍是其核心投入方向。
https://x.com/danshipper/status/2098481799047647715
https://x.com/danshipper/status/2098476917448118321
播客
No Priors — Coinbase’s Everything Exchange: Agentic Finance, Stablecoins, and Tokenization with CEO Brian Armstrong
核心要点:AI agent 要成为真正的经济参与者,不仅需要推理和执行能力,还需要能够独立持有资金、支付服务并从每次人工纠正中积累组织知识的金融账户与学习机制。
Brian Armstrong 是 Coinbase 联合创始人兼 CEO,也是抗衰老与长寿公司 New Limit 的联合创始人。他把 Coinbase 的下一阶段概括为三个方向:将股票、商品、crypto、衍生品、perpetual futures 和 prediction markets 汇入 Everything Exchange;扩大 stablecoin 支付;以及建设 Agentic Finance。
Stablecoin 的关键优势是能以低于 1 美分的成本,在不到 1 秒内完成全球转账。传统银行卡交易通常包含约 30 美分固定费用及额外比例费用,因此无法经济地承载 1 美分级别的支付。Coinbase 观察到,约 76% 的 agent 电商交易金额低于 30 美分,常见用途包括购买付费数据、调用专业 agent、获取搜索或金融信息。这使微支付不再是边缘场景,而可能成为 agent 之间调用服务的基础结算方式。
Armstrong 的判断是:“我们不希望 AI 成为没有银行账户的群体。”Coinbase 正同时探索两类账户,一类是与人类身份关联、资金隔离的 agent account,用户可以授权 agent 代为交易或付款;另一类是由 agent 使用的 self-custodial wallet,可持有 stablecoin,甚至融资或发行 token。agent 还可能配备 stablecoin backed credit card,以兼容酒店预订、AWS 资源购买等传统支付场景。
X402 是 Coinbase 孵化并交由 Linux Foundation 的支付协议,Google、Cloudflare 和 AWS 等公司正在参与相关工作。Coinbase Business 则让企业同时接受人类和 agent 的 stablecoin 支付。Armstrong 预计,未来 agent 数量可能超过人类,agent economy 的规模也可能进一步超过 human economy。
Coinbase 内部还在建设名为 Toshi 的 agent harness,以及按团队、代码仓库和个人划分的“brain”。其中记录服务事故、财务控制、A/B test、GitHub 历史和 PR 接受或拒绝的原因。人工审查发现 agent 遗漏内容时,纠正信息必须写回 brain,而不是只修复当前 PR。目标是让后续 agent 自动继承经验,逐步提高一次生成即可接受的 PR 比例,把“递归自我改进”落实为可审计的组织反馈循环。