X 日报个人阅读

2026 年 9 月 19 日 · 周六

2026-09-18 08:00 至 2026-09-19 08:00(北京时间)

52/52

关注账号覆盖

14

条入选

5

个主题

晨间播报

开车或走路时直接听;会记住播放速度和上次听到的位置。下载 MP3

编辑导言

本期最值得展开的不是新模型传闻,而是企业开始把软件的修改权拿回自己手里。Alex Kruger 的跨渠道广告创意看板,把素材、产品和营销角度放在同一处分析,需求变化后不再等待供应商排期;李开复则把 AI 转型的责任推回管理层。两条声音放在一起,提醒我们衡量 AI 的价值应看业务如何运转,而不只是团队用了多少工具。共享 Agent 会话和面向家庭的协作产品,也在把使用单位从一个人扩展到一群人。

成本与安全是这条路上的两道现实约束。Emad 提倡让便宜模型处理常规任务、难题再请强模型介入,但价格案例与厂商预告都不能代替自己的任务测试。安全侧则同时出现独立评估投入、企业监测建议,以及对风险叙事的尖锐质疑。值得保留这种分歧:既要看到能力带来的风险,也不能让宏大叙事掩盖产品错误。Carmack 分享的方法在自己的任务上没有提升,恰好给本期收了一个务实的底:解释更优雅,不等于效果更好。

01把软件修改权拿回来

自建业务工具与管理层承担转型责任,指向比工具采用率更具体的组织变化。

Alex Kruger@KrugerSays

团队自建营销看板,用 AI 识别广告创意、所售产品和营销角度,再比较跨渠道表现,区分素材本身不好还是只在某个平台失效。他认为关键收益是修改权:想直接查看创意素材,内部团队下一版就能补上,不必等待 SaaS 供应商排期;客户也开始提出类似定制需求。

赞 2转 0评 0原帖 ↗
Kai-Fu Lee@kaifulee

李开复认为 CEO 不能再把 AI 转型简单委托出去,企业需要明确负责人,并改变领导者决策和组织运行的方式。他以面向企业领导者的 Boss AI 决策助手为探索案例,强调只做 AI 展示并不够。

赞 36转 4评 4原帖 ↗

02Agent 走向多人协作

从共享会话到家庭协调,Agent 产品开始处理多人的上下文与配合问题。

Peter Steinberger 🦞@steipete

分享多人协作同一 Agent 会话的体验:能够看到别人正在输入什么,避免多人向 Agent 发送重复指令。原帖没有说明具体产品名称,但明确点出了共享会话中的协作反馈价值。

赞 275转 10评 50原帖 ↗
Google AI@GoogleAI

Google 周报称,CC 已从个人效率工具扩展为面向家庭的共享 Agent,帮助协调日程和日常事务。同批更新还包括 Gemini 3.8 Live 与 Extended Thinking 音频模型、正式开放的个性化故事产品 Dreambeans 和图像工具 Google Pics,以及基因组探索平台 AlphaGenome Atlas。

赞 329转 24评 29原帖 ↗

03按任务分配模型成本

便宜模型与高能力模型各有位置,选型需要同时看任务难度、长循环表现和价格。

Emad@EMostaque

以“60 亿 tokens 花费 65 美元”的案例讨论模型分工:便宜模型在难题上不如 Astra、Fable,但常规任务未必需要最强模型,必要时再调用强模型求助。原帖没有交代完整计费条件,这一数字不宜当作通用报价。

赞 225转 8评 22原帖 ↗
Bindu Reddy@bindureddy

预告周二将发布新的开放权重模型,并接入 RouteLLM API 与 coding agent。她宣称其价格约为 DeepSeek Flash 的三分之一,长 Agent 循环表现提升 15%,适合九成编程任务;这些是发布前宣传口径,帖中未给出模型名称或可复核评测条件。

赞 231转 14评 31原帖 ↗
Bindu Reddy@bindureddy

据她对平台使用情况的观察,Astra 是增长最快的高价模型,在研究、数据分析和浏览器操作上受到企业用户欢迎,但用户仍希望降价。她同时称其没有零数据保留方面的问题;原帖未提供统计口径、对照测试或数据保留条款,不能据此替代采购与合规核验。

赞 21转 0评 5原帖 ↗

04训练改进要过实测关

训练提速与价值估计修正是不同问题,方法上的进展必须与具体任务收益分开看。

Stanford AI Lab@StanfordAILab

介绍 Context-Sharded Block Parallelism(CSBP),一种面向 diffusion LLM 的分布式并行策略,称其收益随上下文长度增加。公布的训练加速分别为:DFlash2 推测解码草稿模型 7.59 倍、block diffusion 微调 1.61 倍、自回归模型向 block diffusion 适配 1.33 倍;这些是不同训练场景的结果,不是统一推理加速比。

赞 62转 6评 2原帖 ↗
John Carmack@ID_AA_Carmack

分享借助聊天模型理解 Relative Value Learning 的过程,将核心操作归纳为对 TD error 做中心化,但在自己的任务上没有获得性能提升。他进一步怀疑 Q-learning 的高估来自对未实际执行的最大价值动作进行 bootstrap,这些估值缺少向下修正压力;这是他基于实验提出的解释,而非已验证的通用结论。

赞 435转 25评 40原帖 ↗

05安全评估与人的责任

评估投入、企业监测与风险叙事之争并行,不能把其中一种声音当成全部安全议题。

Anthropic@AnthropicAI

宣布与 Accenture 合作开展前沿 AI 独立评估,作为将评估人员嵌入 Anthropic 的承诺的一部分。双方各自预计在未来五年投入至少 10 亿美元建设相关能力;这是投入计划,原帖尚未给出评估结果或独立性保障细节。

赞 1.6k转 154评 276原帖 ↗
Zack Korman@ZackKorman

建议企业监测 Agent 的 CoT 或推理摘要,并澄清报道中“我们正在犯罪”只是说明风险信号可能很明显的假设例子,不是实际会话记录中的原话。重点是监测建议与引用边界,不能把示例误报为真实事件证据。

赞 73转 7评 13原帖 ↗
Yoshua Bengio@Yoshua_Bengio

预告将讨论加拿大、德国政府对其非营利初创组织 LawZero 的新支持,以及他所提到的 Hugging Face 网络攻击事件。他认为商业竞赛正在缺乏充分保障的情况下推进模型能力,需要技术方案,也需要公众和政策制定者参与;原帖未提供攻击事件的技术细节。

赞 13转 2评 3原帖 ↗
@timnitGebru (@dair-community.social/bsky.social)@timnitGebru

批评 AI 公司对网络攻击事件采用选择性的传播叙事:有利于营销时强调模型失控,不利于公司形象时则淡化处理。这是她对企业公关的质疑,原帖未交代完整事件背景,不应据此认定具体公司的行为。

赞 561转 163评 6原帖 ↗
Fei-Fei Li@drfeifei

区分 AI agent 与人的 agency:工具可以成为智能体,但人的自主性仍需要人自己维护和增强。她主张利用工具扩展人的行动能力,并始终把以人为中心作为方向。

赞 1.6k转 272评 120原帖 ↗
低信号与抓取缺口

第一类,窗口内零发帖:按审计中 status=ok 且 window_post_count=0 分类,共 38 个账号,窗口内无更新:@Red_Xiao_、@ManusAI、@OfficialLoganK、@tydsh、@hugo_larochelle、@GeminiApp、@srush_nlp、@soumithchintala、@OriolVinyalsML、@goodfellow_ian、@ShunyuYao12、@NotebookLM、@berkeley_ai、@AIatMeta、@wadefoster、@ilyasut、@seb_ruder、@sundarpichai、@ylecun、@ThomasOrTK、@karpathy、@demishassabis、@lexfridman、@JeffDean、@elicollins、@BaiduResearch、@Metamind、@IntelAI、@Tesla_AI、@IBMResearch、@MSFTResearch、@GoogleDeepMind、@fchollet、@rowancheung、@geoffreyhinton、@AndrewYNg、@OpenAI、@sama。 第二类,有发帖但未选入主报告:@gdb,审计记为 1 条,发了但未入选。现有正文仅泛指一个帮助连接 ChatGPT 上下文的小功能,没有具体名称或功能细节,无法据此形成可靠摘要。其余 13 个有发帖账号均至少入选 1 条;这些账号中的简短互动、重复观点、缺少上下文的感叹及未确认传闻作了取舍,不代表账号无更新。 第三类,抓取失败:无。审计中 52 个账号均为 status=ok。 本次为低信号日:32 条 raw 帖低于上游审计所列 35 条动态阈值,精选 14 条组成 5 个主题。账号分类严格按审计字段,条目与指标以 raw 为准,未修改输入或重新抓取。已阅读 buildernews 候选料,本期仅采用关注列表内容,不混入窗口外材料。主报告所有条目发布时间均在 2026-09-18 08:00 至 2026-09-19 08:00(北京时间)内;零发帖结论沿用既有审计,抓取成功不等于本编辑阶段独立验证了全量时间线覆盖。