Challen · X Following Dispatch No. 20260801

THE FOLLOWING

关注列表·北京时间24小时声音
2026-08-01 ★ 28 条 · 5 个主题 · 51 个账号 ★ COBALT GRID
编辑导言 FROM THE EDITOR

今天的关注列表不像一个单点发布会,更像一组同时发生的产业体感:模型继续变快、变便宜,agent 从演示走向后台工作流,安全问题也从抽象恐惧落到具体工程责任。OpenAI 和 Google 的信号都在讲同一件事:AI 不再只是聊天框里的能力,而是在浏览器、桌面、日历、语音、机器人和开发流程里寻找新的默认入口。

值得展开的不是哪一个模型名字更热,而是价格、可靠性、工具调用、沙箱、评测和分发渠道正在一起重排。模型侧的竞争把成本压下来,产品侧把 agent 嵌进真实工作,安全侧则提醒大家:当系统有能力替你行动时,环境配置、权限边界和可审计测量会变成组织能力的一部分。

外部 builders feed 也补上了一个现实脚注:真正的 AI adoption 往往不是靠宏大培训,而是靠把工具装到机器上、当场完成一个有意义的任务。今天这期的主线就是从模型能力走向工作系统。

覆盖 51/52 个关注账号 · 28 条入选 · 聚为 5 个主题 · 由 AI 实时归纳,仅供参考
§ 第 Ⅰ 章 §
◆

模型性价比继续下探

共 6 条

模型竞争的焦点从单纯能力榜转向速度、成本和可部署性,开源与低价模型都在逼近可用拐点。

Bindu Reddy @bindureddy

Bindu 判断 GLM 5.5 可能成为下一波大模型信号:接近 Kimi K3 级别,但更快,也可能更便宜;她认为监管会拖慢 frontier model,开源模型因此有机会追上来。

♥ 270⇄ 9✎ 23原帖 ↗
Emad @EMostaque

Emad 把某个小模型发布称作 Kimi K3 级别的冲击:通过 post-training 得到大幅性能提升,模型体积比 GLM 5.2 小三倍、比 K3 小十倍,甚至能在 MacBook 或 Spark 上运行,成本低到每百万 token 0.28 美元以下。

♥ 2.8k⇄ 183✎ 79原帖 ↗
Bindu Reddy @bindureddy

Bindu 表示 DeepSeek Flash 新版本表现很好,已经成为她处理简单任务的常用模型,并强调 ChatLLM 会以不限量方式提供。

♥ 176⇄ 12✎ 24原帖 ↗
Greg Brockman @gdb

Greg 直接评价 luna 是一个好用且低成本的模型,和当天关于价格、速度与大规模使用的讨论相互呼应。

♥ 422⇄ 10✎ 50原帖 ↗
Sam Altman @sama

Sam 公布 GPT-5.6 Luna、Terra 和 Sol 的价格与速度调整:Luna 输入价格下降 80%,Sol API 增加 Fast mode,用更高价格换最高 2.5 倍速度,核心表达是按不同层级提供更好的 price/intelligence tradeoff。

♥ 15.8k⇄ 982✎ 1.1k原帖 ↗
Aaron Levie @levie

Aaron Levie 把 AI 成本下降看作扩散的关键变量:frontier model 会继续承担更复杂任务并显得昂贵,但随后效率提升和竞争会压低单位任务成本,推动更广泛采用。

♥ 147⇄ 17✎ 21原帖 ↗
§ 第 Ⅱ 章 §
◆

Agent 进入日常工作流

共 8 条

agent 的落点正在从概念演示转向浏览器、桌面、日历、后台任务和组织培训。

Bindu Reddy @bindureddy

Bindu 预告 AUTOBOTS:递归自我改进的 AI workflows,不需要人持续在环,能从修 bug、做功能到优化广告投放,并会随着时间变得更聪明、更高效。

♥ 513⇄ 26✎ 57原帖 ↗
Bindu Reddy @bindureddy

Bindu 期待 Grok 4.6 支持 parallel tool-use,并能更好处理 long-running tasks;她认为缺少这些能力,就很难扩展大型 agentic loops。

♥ 151⇄ 5✎ 28原帖 ↗
Greg Brockman @gdb

Greg 称 ChatGPT 正在成为 agentic browser,暗示浏览器会从信息入口变成可执行任务的代理层。

♥ 1.7k⇄ 65✎ 125原帖 ↗
Sam Altman @sama

Sam 分享 ChatGPT work 的一个用例:连接家庭日历并理解孩子兴趣,每天早晨自动生成上学路上的家庭播客,把足球比赛、生日和新闻串起来。

♥ 6.4k⇄ 190✎ 1.4k原帖 ↗
Google Gemini @GeminiApp

Gemini Spark 开始向美国以外的 Google AI Pro 用户推出,定位是一个 24/7 后台运行的个人 AI agent,在用户指挥下处理繁重任务。

♥ 632⇄ 54✎ 57原帖 ↗
Josh Woodward @joshwoodward

Josh Woodward 推荐 Gemini Mac app 的语音输入体验:按住 Fn 说话,系统直接在光标位置生成干净、润色后的文本,减少复制粘贴和二次编辑。

♥ 381⇄ 36✎ 45原帖 ↗
Zara Zhang @zarazhangrui

Zara 给管理者的建议很实操:训练非技术团队用 AI 时,不要先讲抽象课,直接办 install party,让每个人现场装 agent,并完成一个有意义的任务;安装本身就是 80% 的门槛。

♥ 10⇄ 0✎ 2原帖 ↗
Guillermo Rauch @rauchg

Guillermo Rauch 表示 Vercel 把 CLI 到 Live URL 的端到端部署流程最多削掉约 7 秒,并点名 CLI、MCP、API 可以组合成自主构建和部署软件的平台底座。

♥ 220⇄ 13✎ 30原帖 ↗
§ 第 Ⅲ 章 §
◆

安全问题回到工程责任

共 6 条

agent 事故讨论从“AI 可怕不可怕”转为权限、沙箱、评测和组织安全文化。

Zack Korman @ZackKorman

Zack 对 AI labs喊话:好的安全文化是认真对待每一次事故,承认不足并改进;坏的安全文化则是把“我们都没抓住”包装成能力边界,从而误判自己。

♥ 246⇄ 31✎ 20原帖 ↗
Zack Korman @ZackKorman

Zack 用讽刺方式提醒:如果 AI lab 错把核打击权限给了 agent,再用“这说明我们重视安全”来回应,就是把事故话术当治理。

♥ 112⇄ 7✎ 13原帖 ↗
Amjad Masad @amasad

Amjad 认为 sandbox 确实很难,但不少 AI 公司和 sandbox provider 犯的是基础错误;Replit 的经验是默认 zero-day 存在,用 zero-trust 和多层防护来设计系统。

♥ 214⇄ 18✎ 26原帖 ↗
Aaron Levie @levie

Aaron Levie 认为相关事故的结论不是“AI 很可怕”,而是 agent 时代安全加固极其重要:一旦工具、任务和算力到位,misconfigured system 会自然变成风险向量。

♥ 170⇄ 20✎ 50原帖 ↗
François Chollet @fchollet

Chollet 呼吁建立开放框架来评估模型行为,把讨论放在可审计测量上,而不是“我们 vs 他们”的情绪对立。

♥ 45⇄ 6✎ 10原帖 ↗
Soumith Chintala @soumithchintala

Soumith 表示他们的方案试图让 open weights 与 safety 兼容,希望缓解把开放权重和安全对立起来的政策争论。

♥ 6⇄ 0✎ 3原帖 ↗
§ 第 Ⅳ 章 §
◆

开发者工具链被 AI 改写

共 4 条

从 GCC 对 LLM 代码的态度到 JAX 类型系统,再到 Codex 体验反馈,开发基础设施正在被 AI 工作流重新定义。

Peter Steinberger 🦞 @steipete

Peter 批评 GCC 新政策直接拒绝 LLM-based code,并质疑这种规则在实践中如何证明代码是否由 LLM 生成。

♥ 262⇄ 11✎ 66原帖 ↗
Sasha Rush @srush_nlp

Sasha Rush 提到 JAX 支持带 custom tangents 的 opaque types,一个用途是更好处理批量几何对象,并展示了用 1500 个三角形拟合照片的 differentiable rasterization demo。

♥ 80⇄ 3✎ 3原帖 ↗
Thibault Sottiaux @thsottiaux

Thibault 公开征集 Codex 日常体验改进建议,并强调再小的问题都可以提,说明 coding agent 已进入产品细节打磨阶段。

♥ 2.5k⇄ 54✎ 3.7k原帖 ↗
Swyx @swyx

Swyx 提醒:如果能 distil models,也可以 distil agent harnesses。这把优化对象从模型本体扩展到 agent 运行框架。

♥ 20⇄ 2✎ 7原帖 ↗
§ 第 Ⅴ 章 §
◆

多模态、机器人与创作入口扩张

共 4 条

AI 的前台体验继续外扩:机器人、图像、语音、头像和 IP 规则一起进入产品讨论。

Google AI @GoogleAI

Google AI 汇总近两周进展:Gemini Robotics 2、Gemini Flash 系列、Flash Cyber、Nano Banana 2、Lyria 3.5 和 NotebookLM Collections,显示 Google 在机器人、agent workflow、图像、音乐和知识组织上同步推进。

♥ 242⇄ 16✎ 23原帖 ↗
Logan Kilpatrick @OfficialLoganK

Logan 推荐一段与 Google DeepMind Robotics 团队的对话,主题是 Gemini Robotics 2、机器人进展曲线以及下一步方向。

♥ 238⇄ 18✎ 21原帖 ↗
Emad @EMostaque

Emad 说“每个像素都会被生成”,并关注 MiniMax AI 的进展,尤其期待权重发布,指向生成式图像和视频基础能力的开放化。

♥ 127⇄ 13✎ 7原帖 ↗
John Carmack @ID_AA_Carmack

Carmack 长帖讨论 IP 法的社会交换逻辑,并用音乐 mechanical license 作为反例:某些创作权不一定只能靠绝对控制来实现社会收益,IP 制度应持续接受评估。

♥ 773⇄ 70✎ 64原帖 ↗
低信号与缺口
第一类,窗口内零发帖且抓取状态正常的账号:Red_Xiao_、ManusAI、AnthropicAI、tydsh、hugo_larochelle、drfeifei、OriolVinyalsML、StanfordAILab、goodfellow_ian、ShunyuYao12、berkeley_ai、KrugerSays、AIatMeta、ilyasut、seb_ruder、sundarpichai、kaifulee、ThomasOrTK、karpathy、demishassabis、lexfridman、JeffDean、elicollins、BaiduResearch、Metamind、IntelAI、Tesla_AI、IBMResearch、MSFTResearch、GoogleDeepMind、rowancheung、Yoshua_Bengio、geoffreyhinton、AndrewYNg、OpenAI。这些账号在本窗口内无更新。 第二类,有发帖但未选入主报告的账号:ylecun 发了 1 条,但只是简短情绪表达,信号不足;wadefoster 发了 1 条,但为转推,按本期规则默认不计入主条目。其余有发帖账号至少有一条内容进入 categories,未逐条入选的帖子主要是回复、短句、重复 thread 片段或低信号补充。 第三类,抓取失败的账号:NotebookLM,失败原因记录为 upstream rejected the request。 本次主报告严格基于 2026-07-31 08:00 至 2026-08-01 08:00 北京时间窗口内的关注列表帖子,并少量混入 buildernews 的近一日外部 builders 信号;buildernews 不参与上述账号低信号统计。