OpenAI 发布由 GPT-6 Astra 驱动的 dots,将其定位为始终在线、可持续承接任务的 Agent。帖文强调广泛的任务能力,但没有提供独立可靠性验证。
X 日报个人阅读
2026 年 9 月 30 日 · 周三
2026-09-29 08:00 至 2026-09-30 08:00(北京时间)
关注账号覆盖
条入选
个主题
晨间播报
开车或走路时直接听;会记住播放速度和上次听到的位置。下载 MP3
编辑导言
本期最密集的声音来自 OpenAI DevDay,但值得记住的不只是新模型名称。dots 把全天候后台执行推到个人产品层,Zapier 与 Muse 的连接、Oracle Fusion Claw 与 Gemini 的组合,则把同一个问题带进业务流程:Agent 能接哪些系统,哪些事可以自己做,哪些必须先问人。发布方对能力的描述仍是产品承诺,不能直接当作无人值守的可靠性证明。
另一条主线是任务经济账。GPT-6.1 Sol 的价格和缓存折扣、Ultrafast 的速度档位,都在改变开发者的成本选择。Wade Foster 给出的 AutomationBench 数据尤其值得细读:Sol 达到与 Opus 5.5 相同的一个得分点时,单任务成本约为三分之一,但这个得分点本身只有 36.1%,且 Opus 5.5 仍保持该评测最高总分。便宜到可以规模化尝试,与可靠到可以放手执行,是两件事。
发布会之外,本期也有几条更耐读的信号。Berkeley 把触觉接触的演变纳入世界模型,微软用多模态生物学模型辅助筛选实验假设;人才招聘、通用性评测和独立审计的讨论,则都在追问能力如何被证明。本期仅从关注列表的 63 条窗口内原帖选入 23 条,合并看待重复宣传,不把缺少上下文的感叹补写成新闻;所有产品与研究结论均依据所给帖文,未另行外部核验。
01常驻 Agent 接入工作流
从聊天入口到企业运行环境,关注点转向持续执行、系统连接和自主权限。
dots 的权限由用户设定:哪些任务可自主执行、哪些必须先确认、哪些永远不能做。用户自行选择连接的应用;dot 在独立云电脑上运行,连接个人电脑并非必选。
Zapier 已成为 Meta 个人 Agent Muse 的连接器。Foster 称,Muse 可通过 Zapier MCP 选择应用、编排并部署 Next Gen Zap,也能在 9,000 多个应用中执行单次操作;Next Gen Zaps 目前处于早期体验阶段。
Kurian 介绍 Oracle 新推出的 Fusion Claw:为企业 Agent 应用提供规模化自主执行的运行环境。接入 Gemini 的思路是把模型推理与 Oracle 的确定性执行结合,让复杂流程在预设业务规则内运行。
Reddy 展示自我改进型个人 Agent 的产品方向:通过 WhatsApp 或 Telegram 交互,保留持久记忆,学习用户的工作方式并自动处理繁重任务。原帖未说明具体产品名或实测边界。
02模型成本与速度重算
价格、缓存和推理速度共同影响可承担的任务规模,但成本优势不能替代成功率。
OpenAI 发布 GPT-6.1 Sol,宣称以 Astra 五分之一的价格提供接近 Astra 的智能水平。这是厂商对能力与性价比的定位,并非所有任务都已达到同等效果的证明。
GPT-6.1 Sol 的缓存输入价格为每百万 tokens 0.10 美元,比标准输入价格低 95%,比 GPT-6 Sol 的缓存输入价格低 50%。这项降价针对缓存命中的输入,不能等同于全部调用成本下降 95%。
Foster 报告 Zapier AutomationBench 结果:GPT-6.1 Sol 在最高 effort 下得分 36.1%,每任务约 0.29 美元;Opus 5.5 达到同一得分点约需 0.88 美元。Sol 在运营任务上得分 61%,但 Opus 5.5 仍保持该评测最高总分,不能把等分成本比较写成全面胜出。
Reddy 汇总 GPT-6.1 Sol 的输入、输出报价分别为每百万 tokens 2 美元和 10 美元,同时对其达到 Astra 水平的说法保留怀疑。该帖提供的是发布时的评论,不是独立测评。
OpenAI 推出高级速度档 Ultrafast,称 Codex 中的 token 生成速度最高提升至 8 倍、达到每秒 300 tokens,API 中最高提升至 6 倍。这里衡量的是生成速度,不是端到端任务耗时。
Ultrafast 已面向 Codex、ChatGPT Work 和 API 中的 GPT-6 Astra 开放,GPT-6.1 Sol 支持仍待推出。OpenAI 同时介绍 Pro 500 方案,在 Codex 与 ChatGPT Work 中提供 Ultrafast 及其所称 Plus 25 倍的使用额度。
03安全进入持续运行环节
训练安全、云端代码审查与 Agent 监控,分别对应上线前后不同的责任边界。
OpenAI 分享其保护前沿 RL 训练运行安全的思路,并给出相关文章入口。现有帖文没有展开防护机制,不能据此推断具体隔离、监控或权限方案。
Codex Security Cloud 升级,默认包含通过 Daybreak Blue 使用网络安全模型的能力。它可扫描整个 GitHub 仓库、持续审查新提交、调查并去重问题,以及准备待人工审阅的修复;以 Codex 桌面端和网页端插件提供,电脑关闭后仍可在云端运行。
Korman 在回复中反驳“以前没人知道需要监控 Agent”的说法,认为监控本就应是基本要求。该条保留为明确的运行安全观点,不据缺失的对话背景指认具体事故。
04能力要拿什么证明
模型通用性和人的 AI 技能都需要可检验的表现,而非工具清单或自我评价。
Chollet 提出检验人类水平通用性的一种元基准:能否在下一版 ARC-AGI 发布后立即通过,而不只是适应已知版本。这是一条评测思路,不是某个模型已经通过的结果。
吴恩达宣布 Pearson 正在收购 Workera,并回顾其按任务和岗位严格衡量技能的路线。他认为 AI 的进展让技能测量更重要,可帮助企业辨识员工优势及待发展领域;帖文没有披露交易金额。
Kruger 分享 AI 人才筛选标准:不看候选人声称会多少工具,而看做出了什么、为什么做、哪里出过问题,以及如何修好。作品与排障过程比“熟悉 Claude、ChatGPT、Cursor”等标签更有辨识度。
05世界模型走向触觉与生物
两项研究把多模态建模用于具体问题,价值在于预测与实验反馈,而不只是生成内容。
Berkeley 发布 DexTacWAM,将预训练视频世界模型扩展为视觉与触觉的 World-Action Model,预测多指接触变化并生成动作。团队报告六项灵巧操作任务平均得分 70.6,最强基线为 38.0;把预测触觉的隐表示换成直接触觉特征后,四任务均分从 74.7 降至 26.6。代码、权重与数据已据帖开源。
微软研究院介绍早期研究 Quine,目标是构建跨生物尺度与模态的生物学世界模型,帮助科学家在计算空间中搜索并优先筛选实验假设,再用实验结果反馈改进研究方向。该帖未给出量化效果或成熟产品发布信息。
06谁来定义 AI 的公共承诺
用户意见能否公开、独立审计是否具备资源、宣传如何影响信任,构成发布热潮的另一面。
Anthropic 启动新一轮 Interviewer 研究,征集用户使用 AI 的体验、期待及对公司的要求,并允许参与者选择公开回答。研究期为 9 月 29 日至 10 月 6 日,面向 Claude 和 Claude Code 的 Free、Pro、Max 用户;公司称结果将影响 Anthropic Institute 研究与决策。
Gebru 批评媒体讨论失控 AI 时的资源与话语权差距:富豪和获得巨额资助、以防止灭绝为目标的 AI safety 人士占据显著位置,而她以自嘲对照自身资源不足。这是她对公共讨论结构的批评。
Emad 质疑前沿模型独立审计的现实供给:是否有足够合格的评估者,以及他们是否需要极高的算力投入才能做好工作。原帖以疑问提出人才和资源门槛,没有给出从业人数或成本估计。
Chollet 批评“AI 杀死了某行业”“某职业完了”式宣传,认为这类毁灭性叙事通常不准确,却会塑造公众对 AI 的印象,并招致反弹。
低信号与抓取缺口
第一类,窗口内零发帖:依据 x_fetch_audit.json 中 status=ok 且 window_post_count=0,以下 35 个账号窗口内无更新:@Red_Xiao_、@OfficialLoganK、@tydsh、@hugo_larochelle、@drfeifei、@GeminiApp、@srush_nlp、@soumithchintala、@OriolVinyalsML、@StanfordAILab、@goodfellow_ian、@ShunyuYao12、@NotebookLM、@AIatMeta、@ilyasut、@seb_ruder、@sundarpichai、@kaifulee、@ylecun、@karpathy、@demishassabis、@lexfridman、@JeffDean、@elicollins、@BaiduResearch、@Metamind、@IntelAI、@Tesla_AI、@IBMResearch、@GoogleDeepMind、@GoogleAI、@rowancheung、@ID_AA_Carmack、@Yoshua_Bengio、@geoffreyhinton。 第二类,有发帖但未选入主报告:@steipete(审计 2 条,回复和缺少上下文的简短评价)、@ManusAI(1 条,活动招呼)、@gdb(1 条,与 OpenAI 的 RL 安全分享重复)、@sama(4 条,DevDay 预告及与官方公告重复的产品宣传)。这些账号均发了但未入选,不能视为无更新。其他入选账号也有重复宣传、短回复或低信息量帖子被舍弃。 第三类,抓取失败:无。审计中 52 个账号均为 status=ok。 本次主报告仅采用 2026-09-29 08:00 至 2026-09-30 08:00(北京时间)内发布的关注列表帖文。buildernews 候选料已阅读,本期未采用,不参与上述账号统计。原始帖文与逐账号审计保持只读,未重新抓取。