本期最密集的声音来自 Gemini 4 Argon,但比发布声量更值得看的是能力与可用范围之间的距离。Google 将它定位于长流程推理、软件工程和企业知识工作,目前先向 Fairwind 计划的可信测试者开放。Wade Foster 披露的 AutomationBench 结果也给热度加了一把尺子:高推理档得分 51.3%,中档 50.1%,且运营、销售与 HR 的表现明显不同。它值得进入评测清单,却还不能被理解为任意业务流程都能放心托管。
另一条更贴近日常建设的线索,是把一次性的提示变成可重复使用、可追责的工作方式。Gemini 宣布 Skills 可自动匹配任务、叠加使用,并将承接 Gems;Manus 开放自带 API key;Zapier 则把 MCP 动作、执行人和企业连接放进统一审计。这些变化放在一起看,团队要补的并不只是模型订阅,而是任务如何复用、权限归谁、出错后如何查清。Alex Kruger 关于优先做三个高回报场景的建议,比再发一轮许可证更有操作价值。
安全讨论也出现了两种尺度:一边是白宫协议、开放权重限制及其竞争影响的争论,另一边是给 AI 生成蛋白质加水印、提前预测空间天气灾害的具体工作。本期保留各方立场,但不把个人预测写成已落地政策,也不把缺少上下文的争执或模型传闻当作新闻事实。
新模型的看点不仅是长流程能力,还包括受限开放、推理成本与分业务评测中的短板。
宣布 Gemini 4 Argon,面向编程、企业知识工作与网络安全防御中的复杂流程;本轮通过 Fairwind 计划向一组可信测试者开放,并非全面开放使用。
称 Argon 能在长周期复杂工作流中持续进行深度推理,覆盖软件工程、法律、金融和网络防御;输出 token 上限扩至 100 万。更广泛开放尚待后续安排。
公布 Argon 上线初期输入 2 美元、输出 10 美元的优惠定价,并强调先向网络防御人员开放,随后争取扩大范围。该帖未写计价单位,不能仅据此估算单任务费用。
披露 AutomationBench 分领域成绩:Argon 在六个领域中的五个领先,运营为 68%,销售与营销各 58%;支持业务 45%、HR 39%,仍是相对薄弱环节。领域差异比单一总分更值得选型时关注。
给出 Argon 的 AutomationBench 总分:高推理档 51.3%,中档 50.1%,中档在销售、运营和金融中反而更高。每任务约调用工具 70 次,1,314 次运行中仅 3 次拒绝;所列标准价为每百万输入 token 4 美元、输出 20 美元,上线期五折。
可复用指令从保存模板走向自动匹配与组合,已有 Gems 用户还需关注分批迁移时间。
介绍 Gemini Skills:把反复执行的任务指令保存下来,减少每次重新输入提示的成本,作为随时可调用的任务快捷方式。
Skills 可从聊天中辅助创建、按提示自动匹配,并同时叠加多项指令,例如个人文风与品牌规范。当前支持加入文本、PDF 和图片参考文件;分享自定义 Skills 与接入 Google Drive 文件仍是后续计划。
宣布 Skills 将替代 Gems,并在 Gems 下线时自动迁移。个人账号从 2026 年 11 月开始,Workspace 商业、企业及非营利客户为 2027 年 3 月,教育客户为 2027 年 6 月。
模型之外,供应商选择、协作信息展示和 CI 等外围环节正在决定实际使用体验。
推出 Manus Flex,允许用户自带 API key,在受支持的模型供应商与 Manus 的 Agent harness、工具和执行环境之间进行组合。开放的是接入方式,帖文未列出支持供应商清单。
认为 Agent 之间的通信不断挤入聊天流会干扰阅读,已把 OC harness 中这类消息收起为一行,按需展开。多 Agent 产品既要保留过程可查,也要控制用户面对的信息量。
分享开发中的摩擦:CI 和 GitHub 都在拖慢他的工作节奏,因此需要重新考虑协作方式。这是个人使用反馈,帖文没有提供具体性能数据或替代方案。
分享 Sol 6.1 第二天的主观体验:定时任务、浏览器操作和数据分析表现较好,并判断价格会推动使用量增长。该帖是使用感受,不是可复现的对照评测。
从发许可证到交付业务成果,团队需要明确场景优先级、能力证据和执行责任。
介绍 Zapier Audit Log:管理员控制团队可访问的应用与动作,连接归公司所有,人员离职后流程仍可运行。MCP 动作与 Zap 执行关联具体人员,内部 API 自定义动作也纳入相同规则,日志可流向 Datadog 或 Splunk。
反对把全员购买 ChatGPT 或 Claude 订阅当作 AI 战略。建议逐部门寻找效率、成本和收入机会,再挑出回报潜力最高、实施路径最短的三个场景集中交付,而不是期待员工自行摸索。
提出 AI 人才的实操筛选标准:做出了什么、哪里出过问题、如何修复,以及业务为什么需要它。这些交付与故障处理证据,比一张 AI 认证更有说服力。
发布小企业使用 AI Agent 的报告,涉及获客、产品建设和财务管理;同时宣布与 ASBDC 合作,提供实操培训与本地指导,帮助企业主起步。帖文未给出具体收益测算。
安全承诺、事实可靠性与市场准入不能混为一谈,政策讨论仍需区分公告和个人判断。
表示已签署 White House Accord on Super Intelligence 和 Joint Commitment on Frontier Responsibilities,强调模型发布前的测试、评估、红队及防滥用措施,并主张通过行业共同规范建立公众信任。
担心开放权重模型会以危险为由遭到限制,认为这未必能阻止攻击者,却可能把企业用户挡在门外。这是作者对监管及竞争后果的预测,不能当作禁令已经出台。
重申不能依赖 LLM 保证事实准确,并批评有效利他主义群体在政策与媒体中的影响。这里保留她对可靠性与政策话语权的质疑,不把帖中的群体指控视为已核实事实。
蛋白质来源标记与空间天气预警,为抽象的安全讨论提供了具体任务和时间尺度。