宣布 Gemini 4 Argon,面向编程、企业知识工作与网络安全防御中的复杂流程;本轮通过 Fairwind 计划向一组可信测试者开放,并非全面开放使用。
X 日报个人阅读
2026 年 10 月 1 日 · 周四
2026-09-30 08:00 至 2026-10-01 08:00(北京时间)
关注账号覆盖
条入选
个主题
晨间播报
开车或走路时直接听;会记住播放速度和上次听到的位置。下载 MP3
编辑导言
本期最密集的声音来自 Gemini 4 Argon,但比发布声量更值得看的是能力与可用范围之间的距离。Google 将它定位于长流程推理、软件工程和企业知识工作,目前先向 Fairwind 计划的可信测试者开放。Wade Foster 披露的 AutomationBench 结果也给热度加了一把尺子:高推理档得分 51.3%,中档 50.1%,且运营、销售与 HR 的表现明显不同。它值得进入评测清单,却还不能被理解为任意业务流程都能放心托管。
另一条更贴近日常建设的线索,是把一次性的提示变成可重复使用、可追责的工作方式。Gemini 宣布 Skills 可自动匹配任务、叠加使用,并将承接 Gems;Manus 开放自带 API key;Zapier 则把 MCP 动作、执行人和企业连接放进统一审计。这些变化放在一起看,团队要补的并不只是模型订阅,而是任务如何复用、权限归谁、出错后如何查清。Alex Kruger 关于优先做三个高回报场景的建议,比再发一轮许可证更有操作价值。
安全讨论也出现了两种尺度:一边是白宫协议、开放权重限制及其竞争影响的争论,另一边是给 AI 生成蛋白质加水印、提前预测空间天气灾害的具体工作。本期保留各方立场,但不把个人预测写成已落地政策,也不把缺少上下文的争执或模型传闻当作新闻事实。
01Argon 的能力与边界
新模型的看点不仅是长流程能力,还包括受限开放、推理成本与分业务评测中的短板。
称 Argon 能在长周期复杂工作流中持续进行深度推理,覆盖软件工程、法律、金融和网络防御;输出 token 上限扩至 100 万。更广泛开放尚待后续安排。
公布 Argon 上线初期输入 2 美元、输出 10 美元的优惠定价,并强调先向网络防御人员开放,随后争取扩大范围。该帖未写计价单位,不能仅据此估算单任务费用。
披露 AutomationBench 分领域成绩:Argon 在六个领域中的五个领先,运营为 68%,销售与营销各 58%;支持业务 45%、HR 39%,仍是相对薄弱环节。领域差异比单一总分更值得选型时关注。
给出 Argon 的 AutomationBench 总分:高推理档 51.3%,中档 50.1%,中档在销售、运营和金融中反而更高。每任务约调用工具 70 次,1,314 次运行中仅 3 次拒绝;所列标准价为每百万输入 token 4 美元、输出 20 美元,上线期五折。
02Skills 接棒 Gems
可复用指令从保存模板走向自动匹配与组合,已有 Gems 用户还需关注分批迁移时间。
介绍 Gemini Skills:把反复执行的任务指令保存下来,减少每次重新输入提示的成本,作为随时可调用的任务快捷方式。
Skills 可从聊天中辅助创建、按提示自动匹配,并同时叠加多项指令,例如个人文风与品牌规范。当前支持加入文本、PDF 和图片参考文件;分享自定义 Skills 与接入 Google Drive 文件仍是后续计划。
宣布 Skills 将替代 Gems,并在 Gems 下线时自动迁移。个人账号从 2026 年 11 月开始,Workspace 商业、企业及非营利客户为 2027 年 3 月,教育客户为 2027 年 6 月。
03Agent 工作台的摩擦
模型之外,供应商选择、协作信息展示和 CI 等外围环节正在决定实际使用体验。
推出 Manus Flex,允许用户自带 API key,在受支持的模型供应商与 Manus 的 Agent harness、工具和执行环境之间进行组合。开放的是接入方式,帖文未列出支持供应商清单。
认为 Agent 之间的通信不断挤入聊天流会干扰阅读,已把 OC harness 中这类消息收起为一行,按需展开。多 Agent 产品既要保留过程可查,也要控制用户面对的信息量。
分享开发中的摩擦:CI 和 GitHub 都在拖慢他的工作节奏,因此需要重新考虑协作方式。这是个人使用反馈,帖文没有提供具体性能数据或替代方案。
分享 Sol 6.1 第二天的主观体验:定时任务、浏览器操作和数据分析表现较好,并判断价格会推动使用量增长。该帖是使用感受,不是可复现的对照评测。
04企业落地要看结果
从发许可证到交付业务成果,团队需要明确场景优先级、能力证据和执行责任。
介绍 Zapier Audit Log:管理员控制团队可访问的应用与动作,连接归公司所有,人员离职后流程仍可运行。MCP 动作与 Zap 执行关联具体人员,内部 API 自定义动作也纳入相同规则,日志可流向 Datadog 或 Splunk。
反对把全员购买 ChatGPT 或 Claude 订阅当作 AI 战略。建议逐部门寻找效率、成本和收入机会,再挑出回报潜力最高、实施路径最短的三个场景集中交付,而不是期待员工自行摸索。
提出 AI 人才的实操筛选标准:做出了什么、哪里出过问题、如何修复,以及业务为什么需要它。这些交付与故障处理证据,比一张 AI 认证更有说服力。
发布小企业使用 AI Agent 的报告,涉及获客、产品建设和财务管理;同时宣布与 ASBDC 合作,提供实操培训与本地指导,帮助企业主起步。帖文未给出具体收益测算。
05安全共识与开放争议
安全承诺、事实可靠性与市场准入不能混为一谈,政策讨论仍需区分公告和个人判断。
表示已签署 White House Accord on Super Intelligence 和 Joint Commitment on Frontier Responsibilities,强调模型发布前的测试、评估、红队及防滥用措施,并主张通过行业共同规范建立公众信任。
担心开放权重模型会以危险为由遭到限制,认为这未必能阻止攻击者,却可能把企业用户挡在门外。这是作者对监管及竞争后果的预测,不能当作禁令已经出台。
重申不能依赖 LLM 保证事实准确,并批评有效利他主义群体在政策与媒体中的影响。这里保留她对可靠性与政策话语权的质疑,不把帖中的群体指控视为已核实事实。
06可落地的科学防护
蛋白质来源标记与空间天气预警,为抽象的安全讨论提供了具体任务和时间尺度。
宣布将 SynthID 用于生物领域,为 AI 生成的蛋白质加入水印,并开源 SynthID Bio 工具供研究社区扩展;称相关研究已在 Nature 发表,将其定位为应对生物安全挑战的一步。
介绍一种机器学习系统,可在空间天气风暴到达前 30 至 60 分钟预测可能受损的位置,针对电力系统、GPS 精度及卫星运行面临的风险提供预警。
低信号与抓取缺口
第一类,窗口内零发帖:依据审计 status=ok 且 window_post_count=0,共 36 个账号窗口内无更新:@Red_Xiao_、@AnthropicAI、@tydsh、@hugo_larochelle、@drfeifei、@srush_nlp、@soumithchintala、@OriolVinyalsML、@StanfordAILab、@goodfellow_ian、@ShunyuYao12、@NotebookLM、@berkeley_ai、@AIatMeta、@ilyasut、@seb_ruder、@kaifulee、@ylecun、@ThomasOrTK、@karpathy、@lexfridman、@JeffDean、@elicollins、@gdb、@BaiduResearch、@Metamind、@IntelAI、@Tesla_AI、@IBMResearch、@fchollet、@rowancheung、@ID_AA_Carmack、@Yoshua_Bengio、@geoffreyhinton、@AndrewYNg、@sama。 第二类,有发帖但未选入主报告:@EMostaque,窗口内发了 2 条但未入选,一条涉及 Getty Images 诉讼成本与债务的个人说法,一条是简短互动;前者仅凭冻结帖文不足以展开核实,后者信息量低。这不是无更新。其余有发帖账号均至少入选一条,重复发布、纯链接和缺少上下文的互动未逐条收录。 第三类,抓取失败:无,52 个账号的 status 均为 ok。 本期从 52 条关注列表 raw 帖中选入 21 条,归为 6 个主题;仅使用北京时间 2026-09-30 08:00 至 2026-10-01 08:00 窗口内的关注帖。已阅读 buildernews 候选,本期未采用,以保持所有主条目均可在关注列表 raw 中追溯;其近一日 feed 不用于判断关注账号是否无更新。所有公告、评测及个人观点均按已有帖文摘要,未重新抓取或外部核验。