本期是一个低信号日,但不是无事发生。关注列表里真正有更新的账号不多,声音却集中在同一条主线上:AI 的问题正在从“哪个模型更强”转向“模型能不能用、该不该锁定、如何把成本和风险管住”。Bindu Reddy 连续谈模型封锁、多模型策略和按场景组合模型,Peter Steinberger 用一句 access blockage 点出了同一个现实:顶级模型不再只是能力问题,也变成供应链和治理问题。
另一条线更工程化。Agent 被继续热捧,但 Wade Foster、Aaron Levie、Zack Korman 和 Guillermo Rauch 都在提醒同一件事:Agent 不是免费的魔法。能用 workflow 解决的任务,不该花四倍成本上 Agent;能接触生产环境的 Agent、Skill、MCP Server,也会成为新的攻击面。今天的信号更像一次冷启动后的校准:AI Coding、Codex、MCP 和个人自动化都在往前走,但真正值得关注的是边界、成本、上下文和可验证性。
顶级模型的可用性正在成为组织架构问题,多模型、开源和供应商去锁定从备选项变成基本盘。
她把美国禁令称为全球组织的 wake-up call:企业开始采用 multi-LLM 策略、试验 open-source,并避免被单一美国模型供应商锁死。
她给出一份按 use case 拆分的模型选择清单:后端 coding、前端、实时、设计、视频、图片、语音、简单 coding 和 always-on 场景分别使用不同模型,核心判断是组合模型才能获得更好表现。
她把 Anthropic 导致 AI 被禁作为反事实讨论:如果 Fable 和 GPT 5.6 没被禁,社区此刻会充满 prompts 和 demos,离 AGI 的体感也会更近。
她提到 Grok 4.5 处于 beta,外部反馈不错,并期待它成为一个快速的 agentic model,前提是不要再次被禁。
他引用“access blockage rarely stops determined users”,强调访问封锁很难真正阻止有动机的用户,只会改变他们绕路的方式。
他讨论 eval 里的 inference budget 口径:open models 的 dollar per token 更有优势,因此比较 thinking levels 时不应只看 token 数,而应按实际推理成本衡量。
Agent 从概念兴奋期进入治理期,成本、权限、MCP 和 Skill 的攻击面都开始被反复点名。
他用一句话讽刺 Agent 过度使用:如果一个任务本来可以用 workflow 解决,却花四倍成本上 Agent,就是架构选择出了问题。
他列出 AI 时代会被黑的路径:带生产权限的 OpenClaw、恶意 skill、被攻陷的 MCP server 都排在真正高级威胁之前。
他提醒 Mythos/Sol 这类网络安全能力攻防两用,如果对手拿到等价能力,会对仍不了解潜在漏洞的公司构成严重威胁,并建议用 deepsec 或类似 harness 检测。
他把 AI token cost optimization 拉回业务层:真正省钱的不是抽象压 token,而是中间层深刻理解 workflow、context 和 business process,再为具体场景做 eval、UX 和交付支持。
AI Coding 的讨论不再只是能不能写代码,而是产品细节、跨平台绕法、长线程体验和非工程师 builder 的能力迁移。
他提到自己让 Codex 把 macOS Codex app 改成 Linux app 作为 workaround,说明 AI Coding 已经进入“让工具改造工具”的日常用法。
他总结 Codex 的一批产品改进:长线程处理、可悬停导航栏、设置搜索、缩放后的浮层对齐、复制到 Slack 保留 Markdown,以及大文本粘贴不再冻结 UI。
他用“Sol when operating Codex”做梗,暗示强模型与开发工具结合后,操作体验本身也在变成社区文化素材。
她说自己去年几乎不知道 GitHub 怎么用,如今已有 10k GitHub followers,且仍然不能手写代码。这是 AI Coding 把 builder 门槛下移的一个清晰样本。
从 Tesla 的 real-world intelligence 到 ChatGPT 城市生活案例,AI 的叙事继续从屏幕内扩展到现实世界和个人系统。
Tesla AI 用“Real-world intelligence”概括其方向,延续把 AI 从纯对话模型推向物理世界感知与行动的叙事。
他分享 ChatGPT 在 Bengaluru 日常生活中的帮助案例,信号点不是模型炫技,而是 AI 正在进入具体城市和具体生活场景。
Hinton 推荐 Adam Brown 关于 AI 对物理学未来影响的讲座,把 AI 的长期影响拉回科学发现和基础研究。
他展示每周健康检查邮件:Hermes 从智能体重秤、Fitbit、Google Health、MCP server 和自己 vibe coded 的健身 app 拉数据,形成个人健康目标的自动复盘。