她判断小型持续学习模型可能很快出现,背后依据是多家隐身实验室正在取得实质进展,近期仍可能出现一次显著的 AI 突破。
X 日报个人阅读
2026 年 8 月 25 日 · 周二
2026-08-24 08:00 至 2026-08-25 08:00(北京时间)
关注账号覆盖
条入选
个主题
晨间播报
开车或走路时直接听;会记住播放速度和上次听到的位置。下载 MP3
编辑导言
这一期的主旋律不是又出现了哪个更大的模型,而是 AI 开始被当作基础设施经营。小模型承担多数调用、Gateway 吸收价格波动、可靠性与效率进入核心指标,行业关注点正从单次能力展示转向持续可用和成本结构。
另一条更值得展开的线索,是软件、组织和评测都在围绕 Agent 重写。系统不只要提供功能,还要能被 prompt 改造、被 Agent 调用并留下可诊断的中间结果。企业落地的价值也不再只是让个人快一点,而是收回漏掉的收入、替代外包与订阅、推迟增员,并让一线员工开始建设消除工作的系统。
01模型成为基础设施
模型竞争正在从参数规模转向效率、可靠性、调用成本与持续学习能力。
她预测半年内 95% 的任务会由约 250B 的开源小模型完成,大模型则负责复杂任务和训练小模型,多数 token 消耗将下沉到小模型。
他认为 2026 年将是企业真正重视模型效率与可靠性的一年,因为模型已经从实验能力变成关键基础设施。
OpenAI Sol 降价后成为 Vercel AI Gateway 增长最快的 frontier model。他据此判断推理需求对价格高度敏感,Gateway 会因吸收价格波动、降低成本而成为必需层。
02软件转向 Agent 原生
软件的护城河正从固定界面转向开放协议、可组合能力和可由 Agent 改造的工作面。
他提出一个直接的软件判断:应该离开那些无法通过 prompt 修改的软件,用户对软件的期待正在从可配置走向可现场改造。
他预测 system of record 必须升级成 AI harness,为 Agent 提供上下文、动作和反馈闭环,否则会被 Agent 原生系统取代。
Vercel 扩展 fx 的路线押注开放协议,包括 MCP、Skills、Plugins 和 Unix 式组合。libfx 则负责把能力嵌入 CLI、后台 Agent 与 software factory。
03企业开始算 AI 总账
AI 落地的价值口径从个人提效扩展到收入回收、软件替代、组织扩容和数据沉淀。
意大利汽车经销商 Autotorino 用 AssemblyAI、OpenAI、Zapier 和 Salesforce 接住漏接电话,每月恢复 1500 个客户请求,并影响约 15 万欧元净利润。关键做法是拆分并调优低准确率步骤,直到 CRM 数据可被业务信任。
Scale Army 的两个 AI Implementation Pod 分别建设线索抓取、外呼漏斗和 B2B SMS Agent。收益不只来自执行加速,而是团队开始直接建设可复用的业务系统。
他把 AI 员工的价值重新记账:少雇外包、少买软件、提高现有团队产能并推迟增员,这些结构性节省比单个岗位快一点更重要。
Google Cloud 与 Verizon 达成战略合作,将包括 Gemini Enterprise 在内的全栈 AI 用于客户体验现代化、企业数据统一和规模化部署。
04评测走向可诊断
学习与评测正在向开放教材、跨框架工具和分阶段诊断靠拢,目标是不只知道错了,还知道错在哪里。
他推荐《Deep Learning with Python》第 15 至 16 章作为从零构建 LLM 的入口,尤其强调第 15 章对 dot-product attention 为何有效的解释。
Microsoft Research 发布 Skala 1.1,提升深度学习 exchange-correlation functional 的精度与计算化学生态兼容性,并用持续更新的 benchmark 跟踪性能。
评测粒度应落在各阶段的 jobs to be done,而不是只核对最终答案。金融 Agent 可分别评估客户理解、证据收集、数据分析和推荐,错误出现时才能定位并继续拆解。
AI evals 需要 top-down 与 bottom-up 两条线:前者从任务定义推导标准,Claude 能提供帮助;后者从大量真实输出中提炼人的直觉反馈,主要责任仍在人。
05人与 Agent 重新分工
新的知识工作者不只消费 AI 输出,还会复制技能、改造流程并把一次性劳动沉淀为系统。
他把最新进展概括为一种完成知识工作的新方式,信号重点不在单个功能,而在知识任务的整体入口正在改变。
他的真人助理使用 Claude Code 和 Codex 处理播客后期、show notes 与短视频,并复制、改写雇主的 AI skills。AI fluent operator 的能力正在从会用工具升级为会经营 Agent 工作流。
他用一句反问质疑手工编辑代码是否仍应是默认动作,折射出 coding workflow 正从直接写代码转向通过 Agent 表达意图和验收结果。
低信号与抓取缺口
第一类,窗口内零发帖:Red_Xiao_、ManusAI、AnthropicAI、tydsh、hugo_larochelle、drfeifei、GeminiApp、soumithchintala、OriolVinyalsML、StanfordAILab、ShunyuYao12、NotebookLM、berkeley_ai、AIatMeta、ilyasut、seb_ruder、sundarpichai、EMostaque、kaifulee、ylecun、karpathy、demishassabis、lexfridman、JeffDean、elicollins、BaiduResearch、Metamind、IntelAI、Tesla_AI、IBMResearch、GoogleDeepMind、GoogleAI、rowancheung、Yoshua_Bengio、geoffreyhinton、AndrewYNg、OpenAI、sama,共 38 个账号窗口内无更新。第二类,有发帖但未选入主报告:OfficialLoganK、ZackKorman、srush_nlp、goodfellow_ian、timnitGebru、ID_AA_Carmack,共 6 个账号;这些账号发了内容,但因多为简短回复、个人动态、上下文不足或与本期主线相关度较低而未入选。第三类,抓取失败:无。此次关注列表统计严格覆盖 2026-08-24 08:00 至 2026-08-25 08:00(北京时间);buildernews 仅作为近一日外部 builder 信号混编,不计入上述账号分类与精确窗口承诺。