Challen · X Following Dispatch No. 20260708

THE FOLLOWING

关注列表·北京时间24小时声音
2026-07-08 ★ 32 条 · 5 个主题 · 52 个账号 ★ COBALT GRID
编辑导言 FROM THE EDITOR

这一期的主旋律不是单点模型新闻,而是 AI 能力开始被重新装配成可运行的系统:前沿模型排期继续制造预期,企业侧开始讨论 frontier model 与 open weight model 的混合分工,Google、Meta、Replit、Claude Code 这些信号都指向同一个方向,模型本身只是底座,真正的战场在 agent 运行时、eval、工具调用、权限、后台任务和可交付的软件闭环。

值得展开的信号有两条。第一,Agent 产品化正在从 demo 走向基础设施,Managed Agents、Antigravity Skill、Claude Code 起源复盘、Replit 自我改进闭环都在说明,AI Coding 的竞争焦点正在从“会不会写代码”转向“能不能被组织可靠托付”。第二,多模态生成也在 agent 化,Meta Muse Image 把图像生成描述为会调用工具、自我修正、使用 test-time compute 的过程,这和文本 agent 的路线开始合流。

本期也有一层冷静的底色:Yoshua Bengio 提到 UN AI Governance 的安全路径,Swyx 关注 Anthropic J-space 里模型能否感知干预,Baidu、Microsoft、IBM 的研究信号则提醒我们,热闹的产品竞赛背后,稳定训练、基准、量子与科学计算仍是硬底盘。

覆盖 52/52 个关注账号 · 32 条入选 · 聚为 5 个主题 · 由 AI 实时归纳,仅供参考
§ 第 Ⅰ 章 §
◆

模型竞赛进入组合策略

共 6 条

模型新闻从单一大模型发布,转向排期、成本、推理速度和多模型组合的经营问题。

Bindu Reddy @bindureddy

列出 7 月模型排期:GPT 5.6 可能很快发布,Grok 4.5 已在 beta,Gemini 3.5 面向测试者,Deepseek v4 本月 GA,Opus 5 预计月底。

♥ 171⇄ 7✎ 14原帖 ↗
Bindu Reddy @bindureddy

观察到 Gemini 3.5 被传在部分评测上达到 Fable 水平,强调当前模型预期和 hype 已经非常强。

♥ 134⇄ 4✎ 55原帖 ↗
Bindu Reddy @bindureddy

认为 GPT 5.6 sol 周四发布基本被确认,关注点落在更快、更便宜的 inference。

♥ 167⇄ 0✎ 6原帖 ↗
Bindu Reddy @bindureddy

提出企业正在转向混合模型架构:frontier models 负责规划,open weight models 执行简单任务,Kimi、GLM、GPT、Opus 组合会成为胜利配置。

♥ 106⇄ 7✎ 27原帖 ↗
Bindu Reddy @bindureddy

讨论中国可能限制模型对外访问的传闻,将其解读为中国 AI 公司对未来位置的信心,也指出其成本结构不像美国大厂那样巨额亏损。

♥ 193⇄ 11✎ 46原帖 ↗
Aaron Levie @levie

从应用层角度解释开源 AI 与 frontier intelligence 的关系:新场景先靠前沿模型探索,成熟后再把部分 token 迁移到低成本模型或专用模型,关键在应用层能做 eval 和模型选择。

♥ 323⇄ 34✎ 41原帖 ↗
§ 第 Ⅱ 章 §
◆

Agent 运行时走向产品化

共 7 条

Agent 能力正在被封装进 API、Skill、后台任务和产品界面,重点从模型能力转向可托付的运行系统。

Logan Kilpatrick @OfficialLoganK

宣布 Gemini API 的 Managed Agents 更新:支持后台任务、remote MCP 与 function calling、网络凭证刷新,并开放免费层使用。

♥ 677⇄ 58✎ 58原帖 ↗
Logan Kilpatrick @OfficialLoganK

说明 Managed Agents 的目标是降低把高能力 agent 投产的成本、摩擦和复杂度,路线图包括新 UI、Google 构建的客户 agent 等。

♥ 49⇄ 1✎ 7原帖 ↗
Google DeepMind @GoogleDeepMind

发布 Predicting the Past Skill:把 Gemini 直接连接到 Aeneas 与 Ithaca 专家模型,让历史学者用自然语言研究希腊文和拉丁文材料。

♥ 440⇄ 59✎ 32原帖 ↗
Google DeepMind @GoogleDeepMind

解释历史分析中的三个痛点:为每条铭文定制分析和可视化、跨来源映射模式、让非编码用户使用高级 AI 工具,Antigravity Skill 把这些流程转成自然语言操作。

♥ 100⇄ 14✎ 3原帖 ↗
Emad @EMostaque

注意到 Claude 现在可以连续排队提交 prompts,认为这是重要体验变化。

♥ 116⇄ 1✎ 15原帖 ↗
Peter Steinberger 🦞 @steipete

建议在某个工作流里让 Fable 把 Codex 作为 workhorse,体现多 agent、多模型协作中的角色分工思路。

♥ 213⇄ 7✎ 19原帖 ↗
Boris Cherny @bcherny

首次讲述 Claude Code 的构建和发布故事,并强调它起源于 Anthropic 的安全研究,当前仍只是 1% 完成。

♥ 2.5k⇄ 171✎ 113原帖 ↗
§ 第 Ⅲ 章 §
◆

AI 工程与组织实践

共 7 条

AI 进入工程现场后,面试、个人能力、团队试错和交付标准都在被重新定义。

Peter Steinberger 🦞 @steipete

抛出问题:现在大家如何进行 AI-assisted engineering interviews。这条获得大量回复,说明招聘评价体系正在被 AI Coding 改写。

♥ 1.5k⇄ 43✎ 248原帖 ↗
Peter Steinberger 🦞 @steipete

引用观点:当 intelligence 变得充裕,volition 更有价值。真正有差异的人不是用 AI 少工作,而是主动与 AI 对抗式共学、提升能力并完成更多事。

♥ 697⇄ 80✎ 43原帖 ↗
Peter Steinberger 🦞 @steipete

为多机器并行工作和屏幕共享混淆问题做了 nameplate,并补充一个 skill:当 agent 需要上下文时弹出清晰提醒,而不是只出现无上下文的权限弹窗。

♥ 181⇄ 11✎ 12原帖 ↗
Alex Kruger @KrugerSays

强调 founder 不能外包的一类工作是“第一个试新东西”。因为创始人失败的组织成本更低,能替团队承担早期不确定性。

♥ 4⇄ 0✎ 1原帖 ↗
Nan Yu @thenanyu

认为 agent 让早期创业者能并行做更多事,过去靠低效率地 brute force 很多工作,现在被 agent 改造成并行能力。

♥ 3⇄ 0✎ 0原帖 ↗
Guillermo Rauch @rauchg

提出检验 Coding AI 的终极问题不是 token 消耗,而是软件整体有没有变好、公司是否更快交付、用户是否更爱产品;个人软件和团队 agent 实践都成为重要证据。

♥ 372⇄ 18✎ 39原帖 ↗
Amjad Masad @amasad

用 Replit 案例说明 AI 构建工具已进入业务替代场景:一家亚特兰大房地产公司用 Replit-built CRM 替换 Salesforce,节省 10 万美元。

♥ 1.5k⇄ 92✎ 72原帖 ↗
§ 第 Ⅳ 章 §
◆

多模态生成也在 Agent 化

共 6 条

图像、视频、短视频摘要不再只是生成能力展示,而是在走向工具调用、自我修正和可追溯来源。

AI at Meta @AIatMeta

发布 Meta Superintelligence Labs 首批媒体生成模型 Muse Image 与 Muse Video,强调 Muse Image 在指令遵循、精确编辑、多参考合成等方面是 Meta 当前最先进图像模型。

♥ 1.2k⇄ 169✎ 97原帖 ↗
AI at Meta @AIatMeta

说明 Muse Image 不是直接 prompt-to-image 模型,而是以 agent 方式工作:会调用工具、自我优化、用 scaled test-time compute,并与 Muse Spark 协作。

♥ 270⇄ 27✎ 11原帖 ↗
AI at Meta @AIatMeta

进一步解释 Muse Image 的自我修正能力:在 chain of thought 中自发选择局部编辑、完整重生成或工具使用,这种策略来自 RL 训练中的涌现。

♥ 14⇄ 1✎ 1原帖 ↗
AI at Meta @AIatMeta

介绍 Content Seal:Meta AI app 与网站生成的图片内置隐藏 provenance signal,经过裁剪、压缩、缩放仍可保留,并预览公开识别工具。

♥ 15⇄ 2✎ 0原帖 ↗
AI at Meta @AIatMeta

同步预览 Muse Video:在 prompt adherence、视觉保真和时间一致性上具备竞争力,同时承认音视频同步和高速运动物理准确性仍是改进方向。

♥ 231⇄ 30✎ 19原帖 ↗
NotebookLM @NotebookLM

宣布 Short Video Overviews 已在移动端和 Web 面向所有英语用户全面推出,继续把长内容理解包装成更轻量的消费形态。

♥ 285⇄ 29✎ 28原帖 ↗
§ 第 Ⅴ 章 §
◆

研究、治理与可靠性底盘

共 6 条

产品竞赛之外,训练稳定性、基准、科学计算、AI governance 和模型可解释性继续构成底层约束。

Baidu Research @BaiduResearch

Unlimited-OCR 在 Hugging Face 下载量突破 100 万,百度将其视为开源社区强信号。

♥ 23⇄ 2✎ 3原帖 ↗
Baidu Research @BaiduResearch

介绍 AdaGC:通过更好的优化让 LLM 预训练更稳定高效,在 ERNIE 10B-A1.4B 上消除反复 loss spikes、提升准确率并节省 GPU hours。

♥ 6⇄ 0✎ 3原帖 ↗
Microsoft Research @MSFTResearch

概述 Microsoft 在 ICML Seoul 的 100 多篇录用论文,重点包括 Fara 1.5 computer-use agents、抗 critique 的 benchmark、蛋白 ML benchmark FLIP2 和 LLM 推理稳定性。

♥ 22⇄ 7✎ 0原帖 ↗
IBM Research @IBMResearch

IBM、ORNL 与 Cleveland Clinic 的研究展示量子和经典计算如何协作建模 FLiBe 熔盐中的氚化学,这是聚变模拟中的难题之一。

♥ 47⇄ 15✎ 4原帖 ↗
Yoshua Bengio @Yoshua_Bengio

UN Global Dialogue on AI Governance 收尾时,Bengio 对 AI 与全球协作、政策制定的讨论表示鼓舞,并希望继续把 AI 发展引向更安全路径。

♥ 77⇄ 10✎ 4原帖 ↗
Swyx @swyx

解读 Anthropic J-space 论文的关键点:研究者能对推理过程做类似“脑手术”的干预,改变中途主题,而且模型能检测到发生了什么干预,这接近 eval awareness 问题。

♥ 130⇄ 7✎ 18原帖 ↗
低信号与缺口
第一类,窗口内零发帖,status=ok 且 window_post_count=0:Red_Xiao_、ManusAI、AnthropicAI、tydsh、hugo_larochelle、drfeifei、srush_nlp、soumithchintala、OriolVinyalsML、StanfordAILab、goodfellow_ian、ShunyuYao12、berkeley_ai、wadefoster、ilyasut、seb_ruder、sundarpichai、ThomasOrTK、karpathy、demishassabis、lexfridman、JeffDean、elicollins、gdb、Metamind、IntelAI、Tesla_AI、GoogleAI、fchollet、rowancheung、ID_AA_Carmack、geoffreyhinton、AndrewYNg、OpenAI、sama。上述账号可表述为窗口内无更新。第二类,有发帖但未选入主报告:ZackKorman、GeminiApp、kaifulee、ylecun、timnitGebru。这些账号在窗口内有发帖,但主要是回复、短链、活动宣传、足球/社会议题或低上下文评论,未进入本期 AI/agent/研究主线,不能写成无更新。第三类,抓取失败:无,52 个账号全部 status=ok。本次窗口为北京时间 2026-07-07 08:00 至 2026-07-08 08:00,categories 只承诺关注列表在该精确窗口内的帖子;buildernews 作为近一日外部 builder 信号,仅按相关性补充入选,不参与关注账号低信号统计。