本期主线很清楚:AI 关注列表的讨论从谁的模型更强,继续转向能力如何进入真实工作流。OpenAI 登陆 Amazon Bedrock、Google AI Studio 接入 Gmail、Drive 和 Sheets、Codex Sites 让计划直接变成可交互应用,这些都不是单纯的模型新闻,而是在争夺企业和开发者的默认入口。
第二条线是 agentic workflow 的工程化。Zapier 的 AutomationBench、Abacus 的 Agent Swarm、Codex 主动求助通道、Grok Build 的长任务模型,都在说明一个变化:模型排行榜仍然重要,但更关键的是执行链路、成本、互操作和可观测性。
本次按北京时间 08:00 到次日 08:00 重新过滤本轮抓取证据,成功覆盖 52 个账号,窗口内原始帖子 68 条;低信号账号和无更新账号保留在审计中,没有用旧内容或猜测补齐。
OpenAI、Google 和 Gemini 的动态都指向同一件事:模型能力正在被包装进企业云、应用生成器和开发控制台。
OpenAI 推出 Sites:Codex 可以把团队工作、想法和计划转成可交互网站或应用,方便探索、使用和分享。
Greg Brockman 转发 OpenAI 登陆 Amazon Bedrock 的进展,强调 OpenAI 能力进入 AWS 企业分发通道。
Gemini App 预告在 Discord 演示 Gemini Omni,由产品经理展示使用方式和适用场景。
多条内容围绕 AutomationBench、Agent Swarm、模型切换和工具互操作,焦点从单点模型强弱转向持续执行。
Wade Foster 发布 AutomationBench 新一轮结果:GLM 5.1 max 在开源模型批次中领先,但仍明显落后于 Gemini 3.5 Flash 和 Opus 4.8。
Wade Foster 引用 Eric Ries 对 token-maxxing 的判断:如果没有真实 edge,就像职业赌博,容易陷入 LLM psychosis。
Bindu Reddy 展示 Abacus AI 的 Agent Swarm,用多模型构建复杂 SaaS 应用和自动化流程。
Bindu Reddy 给出按场景选模型的主观看法:聊天、设计、编码、视频、开源、OCR、图片分别对应不同最佳模型。
从 Anthropic 的组织访问扩展、Manus 的儿童安全合规,到 Meta AI 可观测性质疑,安全主题更像产品化门槛。
Anthropic 扩大 Project Glasswing,让约 150 家、覆盖 15 个以上国家的组织获得 Claude Mythos Preview 访问。
Manus 介绍 k-ID 创始人 Kieran Donovan 的背景:围绕儿童网络安全与游戏平台合规,已融资超过 5000 万美元。
Manus 表示 k-ID 将 Neimo 合规引擎接入 Manus,覆盖 197 个国家、3000 多个监管源和美国各州规则。
Manus 强调 k-ID 让开发者在工作区内获得类似全球法律团队的能力,以更有信心地处理合规问题。
Zack Korman 评论 Meta AI 相关 bug,认为这暴露了 Meta 对其 AI 行为缺乏足够可观测性。
研究机构和核心人物的窗口内发声不集中在一个发布,但显示 Build、Gemini 与 NVIDIA 生态仍在塑造关注列表的底色。