X / 推特
OpenAI Codex 与 ChatGPT 团队 Thibault Sottiaux
Thibault Sottiaux 判断,2026 年将成为企业真正重视模型效率与可靠性的一年。原因是模型正在从辅助工具转变为企业关键基础设施。进入关键业务流程后,模型能否稳定工作将与能力上限同样重要。效率问题也会直接影响大规模部署时的成本和响应速度。企业选择模型时,评估重点将不再局限于单次演示效果,而会延伸到长期运行表现。
https://x.com/thsottiaux/status/2091581575108653374
Practical AI 教程创作者 Peter Yang
Peter Yang 将 AI evals 分为 top-down 和 bottom-up 两类。Top-down evals 从任务描述出发,思考在没有既有样本的情况下应该检查哪些能力,Claude 很适合协助生成这类评估。Bottom-up evals 则来自对大量实际输出的观察,需要把人的直觉反馈转化成明确的评估标准。他引用 Shreya 的判断指出,Claude 不擅长独立发现这类源于真实样本的问题,因此这部分仍然高度依赖人的判断。Peter 还推荐了 Shreya 与 Hamel 的 AI evals 课程,课程在 Maven 上获得 4.7 分和 900 条评价,下一期从 9 月 5 日开始。他同时分享了与人工助理 Char 协作六个月的经验,Char 使用 Claude Code 和 Codex 处理播客后期制作、节目说明和短视频剪辑。Char 还复制并持续调整 Peter 的 AI skills,使其适配自己的工作流,这说明 AI 原生助理不仅需要操作工具,也需要把可复用流程转化为个人工作系统。
https://x.com/petergyang/status/2091586298779955512
https://x.com/petergyang/status/2091529714104168870
https://x.com/petergyang/status/2091631590799737306
Meta AI 高级总监 Madhu Guru
Madhu Guru 提出了构建 evals 的 Goldilocks principle,也就是评估粒度不能过粗或过细,而要与不同的 jobs to be done 对齐。以金融分析 agent 为例,只检查最终推荐了哪只股票,会掩盖推荐之前多个关键阶段的质量问题。完整流程包括理解客户的投资组合、风险承受能力、投资期限、目标和限制,然后收集股票、行业、宏观环境、Fed 政策及新闻事件等证据。随后还要分析收入增长、估值指引和增长预测,缩小候选股票范围,最后给出股票代码、买卖价格与时间范围。每个阶段都会产生中间输出,因此可以分别建立 eval,形成例如客户理解 92%、证据提取 92%、数据分析 70%、最终推荐 75% 的诊断结果。这样的分层结果能迅速指出问题集中在数据分析阶段,而不是笼统地判定最终答案错误。如果某一阶段仍然过于复杂,还可以继续拆成更小的任务,但拆分程度应以能否诊断并采取行动为准。其核心原则是,让 eval 的粒度刚好足以定位问题和指导改进。
https://x.com/realmadhuguru/status/2091684812012875981
Vercel CEO Guillermo Rauch
Guillermo Rauch 观察到,随着 OpenAI Sol 降价以及 Vercel AI Gateway 提供折扣,Sol 已成为该 Gateway 增长最快的 frontier model。他据此判断,市场对智能能力的需求具有很高弹性,推理成本下降会快速带动使用量增长。价格波动也让 gateway 获得更明确的商业价值,它可以帮助应用及时利用价格变化,降低运营成本并提高利润率。Rauch 因此认为,router 领域升温并非偶然,gateway 最终会成为不可避免的基础设施。他还阐述了扩展 fx 的设计理念,重点采用 MCP、Skills 和 Plugins 等开放协议。更底层的参照仍然是 Unix,即让小程序各自做好一件事,再通过调用其他程序完成组合。配合可嵌入复杂程序的 libfx,开发者可以构建自己的 CLI、后台 agent 或 software factory,并选择在本地或云端运行。
https://x.com/rauchg/status/2091671326897713424
https://x.com/rauchg/status/2091583525661384813
Y Combinator CEO Garry Tan
Garry Tan 预测,systems of record 必须逐渐转变为 AI harnesses,否则可能被 agents 取代。传统记录系统的核心价值是保存和组织业务数据,但 agents 对软件提出了更主动的执行要求。按照他的判断,仅仅充当静态数据源将不足以维持产品地位。此类系统需要提供适合 AI 调用、控制和执行任务的运行环境。未来竞争焦点因此可能从谁保存了记录,转向谁能让 agents 安全有效地利用这些记录完成工作。
https://x.com/garrytan/status/2091742825042030681
官方博客
Anthropic 发布了一个新的 Swift package,让 Apple 开发者可以通过 Foundation Models framework 调用 Claude,处理多步骤推理、代码生成等复杂工作流。Apple 的框架可直接从 Swift 使用模型,并能通过 guided generation 在少量代码中返回带类型的 Swift 值,适合摘要和信息提取等快速、本地任务。当请求超出端侧模型适合处理的范围时,应用可以把结构化输入交给 Claude,并将流式结果返回同一个 SwiftUI 视图。Claude 还能搜索网页获取当前信息,并执行代码进行数据分析。官方举例称,日记应用可以先在设备端生成每日提示,再让 Claude 从数月记录中寻找关联;学习应用可以先在本地解释术语,再把涉及整体知识联系的追问交给 Claude。该 package 负责处理 streaming、tool calls 和 structured responses,让开发者能够在一个用户体验中为不同步骤选择不同模型。官方称这项支持将在次日开放,适用于 iOS 27、iPadOS 27、macOS 27、visionOS 27 和 watchOS 27,接入时需要使用 Anthropic API key。