Challen · X Following Dispatch No. 20260804

THE FOLLOWING

关注列表·北京时间24小时声音
2026-08-04 ★ 21 条 · 5 个主题 · 52 个账号 ★ COBALT GRID
编辑导言 FROM THE EDITOR

今天的主旋律不是某一个模型又刷新了榜单,而是 AI 能力开始沿着三条线同时外溢:基础模型继续快速迭代,数学与理论计算机科学出现可验证的新结果,Agent 则从单次问答进入夜间值守、知识整理和课程生产等持续工作流。模型更强只是起点,如何选模型、搭基础设施、把任务变成可复用流程,正在成为新的工程分水岭。

另一条值得展开的信号来自交互层。实时语音开始把听、说、推理和工具调用拆成并行路径,视频生成也在用免费额度扩大试用面。能力越接近连续运行和自然交互,安全责任、注意力负担与人的角色重建就越不能留到最后讨论。本期一边记录能力边界向外推,一边保留这些落地后的真实摩擦。

覆盖 52/52 个关注账号 · 21 条入选 · 聚为 5 个主题 · 由 AI 实时归纳,仅供参考
§ 第 Ⅰ 章 §
◆

模型竞赛进入组合战

共 5 条

领先幅度、成本和任务适配同时成为决策变量,单一榜单已不足以回答模型该怎么用。

Logan Kilpatrick @OfficialLoganK

Logan 提醒开发者不要低估模型能力的指数增长斜率,即使已经重注模型,实际押注也可能仍然偏保守。

♥ 2.4k⇄ 82✎ 190原帖 ↗
Bindu Reddy @bindureddy

Bindu 判断开源模型仍落后于闭源模型约 12 至 16 周,但差距正在快速收窄。重点不只是追平,而是领先窗口持续缩短。

♥ 281⇄ 10✎ 58原帖 ↗
Bindu Reddy @bindureddy

Bindu 称 Qwen3.8-Max 可能成为新的开源领跑者,并强调其 2.4T 规模、接近 Sonnet 级别的能力预期,以及输入、输出和缓存价格。

♥ 285⇄ 28✎ 43原帖 ↗
Bindu Reddy @bindureddy

面对 DeepSeek Flash 的热度,Bindu 给出逆向判断:它是擅长刷 benchmark 的优质小模型,但实战明显弱于 Grok 4.5,不应被归为 frontier model。

♥ 155⇄ 9✎ 59原帖 ↗
Bindu Reddy @bindureddy

Abacus AI 推出 RouteLLM API,试图在一个入口中聚合新模型,再按任务与成本自动路由,并兼容 Claude、Codex 和 prompt caching。

♥ 282⇄ 16✎ 38原帖 ↗
§ 第 Ⅱ 章 §
◆

AI 开始产出数学结果

共 4 条

可验证的数学问题正成为模型能力率先转化为科研增量的场域。

OpenAI @OpenAI

OpenAI 称下一代主要模型的内部版本,在数学与理论计算机科学的长期开放问题上产出 10 项新结果,按 GPT-5.6 Sol API 价格估算消耗约 2000 美元 token。

♥ 9.1k⇄ 596✎ 381原帖 ↗
OpenAI @OpenAI

OpenAI 将基础数学进展与交通、疾病传播、蛋白质、GPS、天气预报和医学成像联系起来,强调理论突破可能跨层传导到科学与工程。

♥ 917⇄ 21✎ 10原帖 ↗
OpenAI @OpenAI

这些结果覆盖球堆积、编码理论、群论、量子复杂性、格密码和极值组合学,其中包括非 sofic 群存在性与高维球堆积界的指数级改进。

♥ 716⇄ 16✎ 12原帖 ↗
Yann LeCun @ylecun

LeCun 回顾 Courant Institute 从数值分析、PDE 和早期电子计算机一路发展到数学、计算机与数据科学并立,指出长期 HPC 基础设施是 NYU AI 研究起飞的重要条件。

♥ 367⇄ 25✎ 16原帖 ↗
§ 第 Ⅲ 章 §
◆

Agent 从助手变成流水线

共 5 条

Agent 的价值正在从一次性生成转向可调度、可复用、能积累经验的持续生产系统。

Rowan Cheung @rowancheung

有人把闲置的 Claude 与 Codex 额度编排成夜班 Agent,在睡眠期间提交代码、做研究和清理仓库,并主动限额为早晨保留额度。

♥ 5⇄ 0✎ 4原帖 ↗
Rowan Cheung @rowancheung

一条 second brain 流水线把手机 Apple Notes 中的想法交给定时 Claude Cowork skill,夜间自动归档到日历和 Obsidian。

♥ 7⇄ 0✎ 1原帖 ↗
Rowan Cheung @rowancheung

一个可复用 AI skill 能把任意主题展开成自学课程,覆盖模块、课文、可播放的 YouTube 视频和带错题解释的测验。

♥ 12⇄ 2✎ 2原帖 ↗
Microsoft Research @MSFTResearch

Microsoft Research 开源 Orchard,用统一基础设施训练和评估不同任务类型的 AI Agent,同时降低复杂度并支持较小模型取得有竞争力的表现。

♥ 50⇄ 13✎ 6原帖 ↗
Microsoft Research @MSFTResearch

微软研究进展同时覆盖 SocialRL 小模型谈判、非洲语言语音评测和 EvoLib Agent 经验转知识,显示 Agent 研究正从执行扩展到社会互动与长期学习。

♥ 30⇄ 5✎ 4原帖 ↗
§ 第 Ⅳ 章 §
◆

实时多模态重做交互栈

共 4 条

语音与视频不再只是附加入口,底层架构开始围绕连续交互重新设计。

OpenAI @OpenAI

GPT-Live 可以边说边听。为支撑 ChatGPT 规模的自然交互,OpenAI 从客户端到模型重建语音栈,让音频持续流动,不被深度推理和工具调用打断。

♥ 4.4k⇄ 322✎ 269原帖 ↗
OpenAI @OpenAI

新架构让音频走专用快速路径,深度推理和工具调用异步执行,同时把语音会话启动从六次网络往返压缩到一次。

♥ 455⇄ 19✎ 15原帖 ↗
Greg Brockman @gdb

Greg Brockman 将 GPT-Live 定位为一套面向实时音频的新架构与完整技术栈,而不只是现有语音功能的局部升级。

♥ 425⇄ 21✎ 53原帖 ↗
Google Gemini @GeminiApp

Gemini Omni 用限时免费额度推动视频创作试用,免费用户在 2026 年 8 月 4 日太平洋时间午夜前最多可生成 10 个视频。

♥ 324⇄ 22✎ 42原帖 ↗
§ 第 Ⅴ 章 §
◆

能力狂奔后的边界

共 3 条

安全问责、认知负担与身体恢复,正在成为 AI 使用规模化之后不可回避的成本。

Zack Korman @ZackKorman

Zack 呼吁公开调查 OpenAI 与 Anthropic 的 AI 黑客事件,以判断实验室面对的是新型威胁,还是安全管理疏忽,并要求两家公司主动接受审视。

♥ 173⇄ 22✎ 20原帖 ↗
Zack Korman @ZackKorman

Zack 描述近期注意力严重透支,阅读一篇原本五分钟的技术博客也变得困难,甚至考虑让 Codex 转成视频来降低理解门槛。

♥ 10⇄ 1✎ 2原帖 ↗
Rowan Cheung @rowancheung

Rowan 引述日本森林步行研究:三天缓慢林间行走后,参与者自然杀伤细胞活性提升且一个月后仍可测量,提醒高强度技术生活需要主动安排离线恢复。

♥ 4.1k⇄ 688✎ 63原帖 ↗
低信号与缺口
第一类,窗口内零发帖:steipete、Red_Xiao_、ManusAI、AnthropicAI、tydsh、hugo_larochelle、drfeifei、soumithchintala、OriolVinyalsML、StanfordAILab、goodfellow_ian、ShunyuYao12、NotebookLM、berkeley_ai、KrugerSays、AIatMeta、wadefoster、ilyasut、seb_ruder、sundarpichai、EMostaque、kaifulee、ThomasOrTK、karpathy、demishassabis、timnitGebru、lexfridman、JeffDean、elicollins、BaiduResearch、Metamind、IntelAI、Tesla_AI、IBMResearch、GoogleDeepMind、GoogleAI、fchollet、ID_AA_Carmack、Yoshua_Bengio、geoffreyhinton、AndrewYNg、sama,共 42 个账号在窗口内无更新。第二类,有发帖但未选入主报告:srush_nlp,共 1 个账号;其窗口内帖子只有脱离上下文的简短评价,无法可靠提炼,因此发了但未入选。第三类,抓取失败:无。其余 9 个有发帖账号均至少有一条内容进入主报告。本次统计窗口为 2026-08-03 08:00 至 2026-08-04 08:00(北京时间),27 条 raw 帖低于近期开启的动态阈值,按低信号日成报;外部 buildernews 候选料本期未采用。