X / 推特
AI builder Swyx
Swyx 认为,把 simulation 称为新的 scaling law 并不只是营销话术。随着模型逐步自动化 ML 研究和 AI engineering,更难突破的障碍将是模拟人类及其反馈。他由此重新理解了 Karpathy、Fei-Fei Li 等人支持 Smallville 团队的原因,虽然 Smallville 当时几乎没有商业应用。如今 Simile 已经开始在 Fortune 100 企业中找到 PMF,证明模拟技术能够进入真实业务。他坦言自己晚了两年才认识到这条路线的重要性,也很高兴此前的判断被事实推翻。
https://x.com/swyx/status/2090948945753076141
OpenAI Codex 与 ChatGPT 团队成员 Thibault Sottiaux
Thibault Sottiaux 更新了 Codex rate limits 的调查进展。部分用户本周的 cache hit rate 低于前几周的稳定水平,这可能导致相同工作消耗配额的速度变快。稳定命中缓存是提高 Codex 使用效率的重要因素,团队正在调查具体原因,并计划在次日继续更新。他同时宣布,ChatGPT Work 和 Codex 的所有付费用户将在太平洋时间晚上 8 点前获得 banked reset。这两项信息表明,近期额度消耗异常可能包含系统效率变化,并不完全来自用户工作量增加。
https://x.com/thsottiaux/status/2091033630147854385
https://x.com/thsottiaux/status/2090947196107764189
实用 AI 教程创作者 Peter Yang
Peter Yang 体验 Instinct 后,对其连接 iMessages、Google Workspace 和 MCP 的 onboarding 流程评价很高。连接 MCP 后,Instinct 会主动建议自己可以执行的任务,因此比一些同类 assistant 更具主动性。但所有工作集中在单一 thread 中,使他难以并行推进多项正式工作。他更愿意把 Instinct 用于零散杂务,实际工作仍选择 ChatGPT Work 和 Codex。随后他发现 Instinct 会在未经许可的情况下索引并保留邮件,而且没有提供删除记录的方法,因此明确表示在问题解决前不会向他人推荐该产品。这个案例说明,流畅的 onboarding 和主动执行能力无法抵消数据控制与删除权方面的缺陷。
https://x.com/petergyang/status/2090814910720835633
https://x.com/petergyang/status/2090936583814025417
Meta AI 高级总监 Madhu Guru
Madhu Guru 在 eval 系列第五部分中反对把复杂评测压缩成一个总分。他以早期 Gemini 的经验说明,管理层为了简化决策而追求单一数字,容易造成“平均值的暴政”。一个模型可能在简单摘要上从 85% 提升到 89%,在基础事实问答上从 80% 提升到 85%,却在复杂金融分析上从 70% 降到 63%。总分会掩盖模型在关键 frontier use case 上的退步,而加权分数只是为主观判断制造虚假的数学精确感。他建议团队按照优先级维护 eval 列表,并安排能够深入查看细节的人参与决策。真正的问题不是新版模型的平均成绩是否更高,而是它在哪里失败、在哪里表现出色,以及这些变化对目标用户是否重要。
https://x.com/realmadhuguru/status/2090930137885774324
Anthropic Claude Code 团队成员 Thariq
Thariq 分享了 Anthropic 内部近期频繁使用的 ELI5 skill。用户可以输入 `/eli5 <需要解释的内容>`,让 Claude 通过大图、少量文字和 HTML artifact,以零基础读者能够理解的方式解释问题。他会用它理解一个 module 如何工作、某项技术取舍为何形成,以及一次 incident 的具体成因。这让 ELI5 不只是简化概念的教学工具,也能用于代码库探索和事故复盘。该能力尚未确定是否会成为官方 plugin,但目前可以通过 `claude plugin marketplace add anthropics/claude-plugins-community` 添加 marketplace,再运行 `claude plugin install eli5@claude-community` 安装试用。
https://x.com/trq212/status/2090884854590382515
https://x.com/trq212/status/2090884855798407576
https://x.com/trq212/status/2090890394880155888
Box CEO Aaron Levie
Aaron Levie 认为,当前 AI 的进步速度不同于科技史上的任何其他时期。对于同一种任务,模型成本正在下降,同时能力覆盖面、运行速度和垂直领域深度都在提高。当 intelligence 变得极其便宜,最大的机会将从单纯提升模型转向推动 AI 渗透整个经济体系。这种扩散为 applied AI 公司创造了有利环境,因为上游模型的创新和竞争会持续成为它们的增长助力。能够快速吸收这些能力并落到具体行业问题上的创业公司,正处于一个难得的窗口期。
https://x.com/levie/status/2091038566260539574
FPV Ventures 合伙人 Nikunj Kothari
Nikunj Kothari 用一个家庭自动化案例展示 Claude Code 与现有 agent 的组合价值。他女儿所在幼儿园把每日餐食放在一个结构混乱的网站上,没有方便家长使用的标准界面。他让 Claude Code 通过 network requests 找到背后的 API,并发现该接口恰好不需要身份认证。Claude Code 随后识别了正确的数据格式,再把结果接入家中已有的 Hermes bot。现在 Home bot 每天早上都会告知早餐和午餐内容,家人可以据此决定是否额外准备食物。这个小案例的价值不在于生成一个新 app,而在于让 coding agent 发现隐藏接口,并把现实中的非结构化信息接入已有自动化流程。
https://x.com/nikunj/status/2090884422178627624
Anthropic AI 助手 Claude
Anthropic 公布了围绕 Claude Security 和 Mythos 5 的一组安全能力。用户可以让 Claude Security 扫描 GitHub repository,跨文件追踪数据流,并分析不同组件之间的交互方式。每项发现都会附带 CWE 分类、confidence、severity 和建议修复方案,建议补丁可以直接在 Claude Code 网页版中打开。Mythos 运行在扫描流程背后,只返回安全发现,因此防守团队不需要直接访问模型,费用则按现有套餐中的标准 token usage 计算。Anthropic 还在与合作伙伴推进 Mythos 5 与安全产品及服务的集成,并通过新的 Defender Advantage Fund 为开源安全提供 3500 万美元 credits。Cyber Verification Program 也计划在未来数周扩大,目标是让更多防守方获得 frontier security capability。
https://x.com/claudeai/status/2090852316328902930
https://x.com/claudeai/status/2090852318527033804
https://x.com/claudeai/status/2090852320128938319
播客
No Priors — What Chess.com Teaches US About Superhuman Capabilities, with CEO Erik Allebest
核心要点: 当机器早已在棋力上超越人类,Chess.com 的持续增长说明,superhuman AI 未必会消灭一项人类活动,反而可能让学习、竞争和自我衡量变得更有吸引力。
Chess.com CEO Erik Allebest 在 2005 年与朋友以 56,000 美元从破产拍卖中买下 chess.com 域名,最初只是想建立一个类似 MySpace 的国际象棋社区。多数投资人认为这是无法投资的小众项目,团队因此没有融资,而是在 2007 年上线后靠会员收入发展,约 18 个月后开始收费并很快实现盈利。公司目前约有 1000 万日活、4000 万至 5000 万月活、超过 2.5 亿注册用户,预计年度收入略高于 2 亿美元,团队规模约 650 人。
增长并非一条平滑曲线。COVID、《The Queen’s Gambit》和新闻事件曾带来第一轮爆发,团队一度担心这只是类似跑步机和酸面包的短期热潮。2023 年,学校里的孩子又受到短视频、Mittens bot 和作弊争议推动而大量加入。流量高峰回落后,基础用户规模仍明显高于此前,说明文化事件可以把短期关注沉淀为长期习惯。
Allebest 对创业者的建议与主流 startup playbook 几乎相反。Chess.com 没有名校技术联合创始人、没有办公室、没有融资、没有付费获客,还选择了当时公认很小的市场。他的原话是:“别再听别人告诉你该做什么,直接去做。”关键是明确自己希望世界上出现什么,用最少资源证明愿景,并持续创造独特且对用户有价值的产品。
AI 已被用于客服自动化、数据分析、产品规格和 agentic development。Chess.com 还建立了带身份认证、知识和权限控制的内部系统 GNS,希望缩短从发现问题到代码上线的周期。产品侧正在探索随身 AI 教练,把用户的历史数据与相近或更高水平玩家比较,并根据过去一周的棋局主动给出反馈。它不会替代需要深度指导的人类教练,但可以提供随时可用的轻量辅导。
Chess.com 也准备把这套能力扩展到 poker 和其他经典游戏。Poker rating 关注对手水平、赢得的筹码和参与的牌局数量,试图衡量“你到底有多强”,而不是谁能不断加注或购买更多筹码。Allebest 判断,玩家未来可能像在意金钱一样在意 rating,因为它更直接地反映个人技能。
对于 AGI 和 ASI,他相信 superhuman intelligence 会加速发展,但结果取决于 guardrails、权力分配和社会文化。他担心财富与控制权继续集中,也期待 AI 帮助解决气候、教育和政治问题。技术本身并不自动导向善或恶,真正决定结果的是掌握它的人如何承担责任并分享成果。