推出 Fusion Agents 的说法:用 Kimi 2.7、GLM、Opus 4.8 和 GPT 5.5 组合开放子 Agent,目标是从一个 prompt 构建完整 SaaS、移动端应用、连接器和 Stripe 支付。
X 日报个人阅读
2026 年 6 月 17 日 · 周三
2026-06-16 08:00 至 2026-06-17 08:00(北京时间)
关注账号覆盖
条入选
个主题
晨间播报
这一期没有生成音频。
编辑导言
这一期的主旋律很清楚:AI 不是停在模型参数或榜单分数上,而是在进入更具体的工作场景。Gemini 把 Daily Brief 做成早晨代理,Manus 给长任务加上排队输入,Anthropic 开始用经济研究衡量 Claude Code 的任务价值,OpenAI 则把 evals 往真实部署模拟推进。工具正在从“能回答”转向“能嵌入工作节奏”。
另一个信号是选择权和信任成本同时升高。Bindu Reddy 一边押注 open weights、动态切换和多模型组合,一边反对监管式封禁;François Chollet 把 open-source AI 的关键落在效率和数据需求上。与此同时,Zack Korman 对安全行业“假奖项”的连续批评,提醒大家:AI 工具越像基础设施,供应商信誉、评测方式和市场叙事就越不能只看包装。
01Agent 产品进入日常工作流
Agent 不再只是演示概念,而是在日程、长任务、SaaS 构建和知识工作里寻找固定入口。
Manus 增加任务运行中的消息排队能力,用户可以在当前任务结束前继续补充指令,让长任务更像可连续编排的工作流。
Gemini 介绍 Daily Brief:在用户醒来前整理一天信息,并通过点赞、点踩、继续聊天和查看来源来调整个人化早报。
Daily Brief 面向美国 18 岁以上 Google AI Plus、Pro、Ultra 订阅用户开放,说明这个功能已进入订阅分层和区域发布阶段。
NotebookLM 更强版本已向全球 Google AI Ultra 订阅者 100% 推出,强调图表、图片、表格和非结构化想法都可进入知识工作流。
02AI Coding 被量化
Claude Code 不只是开发工具发布,而是被 Anthropic 放进经济价值、职业差异和完成证据的研究框架里。
Anthropic 发布经济研究框架,用来追踪 Claude Code 扩展后的使用人群、任务用途、任务价值变化,以及领域知识如何影响 session 成功率。
研究把 Claude Code session 对应到自由职业市场任务价格,称 10 月到 4 月之间平均 session 的货币价值增长 27%。
Anthropic 比较不同职业使用 Claude Code 的成功率,在最严格的完成标准下,各领域与软件工程之间差距都在 7 个百分点内。
研究发现领域专家更容易成功,但中级用户和专家的差距并不大,暗示只要具备足够领域熟练度,就可能在本领域完成代码任务。
Anthropic 表示会把这些指标纳入 Anthropic Economic Index,用于持续追踪 AI 对工作性质的实际改变。
03评测走向真实部署
OpenAI 的几条更新共同指向一个方向:模型评测要从静态 benchmark 走向生产数据、部署模拟和 agentic trajectory。
OpenAI 强调 evals 的重要性:当 benchmark 饱和或被 gaming 后,需要更好地测量和预测模型进展。
OpenAI 分享 deployment simulation 研究:用近期去标识化用户请求模拟真实部署,在发布前观察候选模型的行为。
OpenAI 称模拟部署能把 evaluation awareness 降到接近真实生产流量,并扩展到带有状态工具的 agentic deployments。
OpenAI 说明 deployment simulation 最依赖代表性生产数据,同时也测试了公开 WildChat 数据集作为较弱但仍有用的部署行为信号。
04开源模型与选择权
围绕 open weights、效率和模型可替换性,关注人讨论的是企业依赖 AI 后的战略选择权。
Chollet 认为开放且可普遍获得的强 AI,需要从推理算力和训练数据需求两方面大幅提升效率,而 symbolic learning 是实现路径。
Bindu 预告 GPT 5.6 和 Gemini 3.5,称性能接近 Fable,成本更低、速度更快、限制更少,反映前沿模型竞争仍在加速。
Bindu 称 GLM 5.2 是 open weights,并在 coding 和 agentic loops 上表现强,和 Kimi 2.7 形成开放模型竞争。
Bindu 主张企业必须 all in open-source:封闭美国模型可能随时被撤回,业务依赖 AI 后,动态切换和选择权会成为必需品。
05信任、监管与行业噪音
当 AI 和安全产品都变成基础设施,监管、供应商诚信和营销包装会直接影响采用判断。
Zack 建议网络安全从业者移除使用虚假奖项包装自己的供应商,因为这说明对方愿意对客户撒谎。
Zack 继续点名“recognition as a service”式假奖项产业,认为这类营销服务没有底线。
Zack 列出一批拿过相关奖项的安全公司,并把问题上升到安全团队是否值得信任。
Zack 对行业里的骗局和低质量包装表达疲惫,核心问题不是单个案例,而是行业为什么总在制造新的不可信信号。
Bindu 批评美国政府阻止 Anthropic 的相关做法,认为这是对一家重视安全公司的不合理打击。
06多模态与创作工具
多模态工具的关注点从“生成一次结果”转向可编辑、可评测、可嵌入创作流程。
Eli 转述 Tribeca 影评观点:Dear Upstairs Neighbors 像一个案例,说明 generative AI 可以作为定制工具辅助艺术家发展想法。
Gemini 转推语音输入改进:移动端麦克风图标支持 70 多种语言和混合语言输入,对非英语用户更友好。
Emad 转推 Factory Agent 的视频生成工作流:当某个镜头失败时,不必整段重生成,而是把每个镜头变成可单独处理的对象。
Sasha 转推 MVEB 视频嵌入基准,随着 AI 生成视频增多,视频 embedding 的质量评测会变得更重要。
低信号与抓取缺口
本次窗口内 raw 帖 57 条,52 个关注账号全部抓取成功,失败账号为空。33 个账号在窗口内无更新:Red_Xiao_、tydsh、drfeifei、soumithchintala、OriolVinyalsML、goodfellow_ian、ShunyuYao12、berkeley_ai、KrugerSays、AIatMeta、ilyasut、seb_ruder、sundarpichai、kaifulee、ThomasOrTK、karpathy、demishassabis、timnitGebru、lexfridman、BaiduResearch、Metamind、IntelAI、Tesla_AI、IBMResearch、MSFTResearch、GoogleDeepMind、GoogleAI、rowancheung、ID_AA_Carmack、Yoshua_Bengio、geoffreyhinton、AndrewYNg、sama。另有 steipete、hugo_larochelle、StanfordAILab、ylecun 在窗口内只有转推;主报告默认不纳入这些账号的转推,除非转推本身构成强产品或研究信号。