这一期最值得展开的,不是下一款模型的传闻,而是 AI 怎样从演示走进可持续运行的系统。Zapier 给出的办法是把确定性步骤交还代码,只让 AI 做需要判断的部分;Peter Steinberger 则提醒,给 Agent 一句含糊的“清理一下”远远不够,目标需要量化。Google Cloud 与法国巴黎银行的新合作把这道题推到企业尺度:除了能否构建 Agent,还要考虑部署、评估和数据主权。
Meta 的实时 Avatar 是本期技术信息最完整的一组帖子。共享语音 token、固定长度历史与蒸馏减少计算量,分别回应了同步、长对话和延迟问题,比单看演示更值得拆解。不过,厂商自述、个人模型体验和已验证结果仍须分开看。关于 AI 意识与失控的讨论也提醒我们:能力可以继续探索,责任却不能推给一个被拟人化的系统。今天关注列表的原始发帖量偏低,本期保留六组有具体内容的信号,不用传闻和脱离上下文的短评填版。
成本、任务验收、企业部署与数据主权,正在成为 Agent 从试用走向常态运行的实际约束。
Zapier 发布 Next Gen Zaps 并开放 beta 候补:用户可用 Claude、GPT 等工具以自然语言构建和部署自动化,确定性步骤由代码执行,AI 只处理需要判断的环节。Foster 给出的会前简报案例,单次成本从 1.12 美元降至 0.12 美元;这是厂商示例,不代表所有流程都能获得相同降幅。
Steinberger 认为,只让 Agent “清理一下”容易使它过早收工,应该给出有挑战且可量化的目标。他的示例是移除最无用的 20% 测试,同时将代码覆盖率变化控制在 2% 以内。这是一种任务设定建议,不是已经验证的测试删减结果。
Google Cloud 与 BNP Paribas 宣布新的五年合作,扩大公有云和 agentic AI 应用。法国巴黎银行将使用 Gemini Enterprise 构建、评估并部署面向特定用途的 Agent;帖文未披露上线规模或业务收益。
李开复将开放与封闭模型的选择、数据主权列为企业和政府采用 AI 的关键问题,尤其关系到中美之外国家如何建设自身 AI 能力。这条帖子提出的是战略议题,并未给出具体部署方案或比较结论。
Meta 同一发布串中的三条互补信息,说明实时数字人如何兼顾语音同步、长对话稳定性与计算成本。
Meta 发布 Muse Realtime Avatar,将 Muse Realtime Voice 转化为具备表情、可实时互动的 Avatar,首先用于 Muse 中的实时对话。重点是让语音交互拥有同步的视觉表达,而非仅生成一段离线视频。
Muse 的语音与 Avatar 共用 speech-token 流:Voice 生成包含内容和韵律的 token,Avatar 据此流式生成视频。系统以固定长度历史作为后续片段的动作上下文,旨在让长对话的计算量保持有界,并同步声音、口型和表情。
Meta 将使用 3-way CFG 的 40 步 diffusion teacher 蒸馏为无需引导的 2 步 causal student,并采用固定长度 KV cache。官方称,每个视频片段的模型评估次数由 120 次降至 2 次,结合 self-forcing 抑制漂移、接近 teacher 质量;这里的 60 倍指评估次数减少,不是实测端到端提速。
同一位使用者对廉价小模型与昂贵编码模型的评价,提示模型价值需要放到具体任务和成本中判断。
Reddy 对 Sol 6 评价较低,却认为 Luna 6 是表现很好的低价小模型,声称其价格约为 Grok 或 MuseSpark 的四分之一,性能优于两者及 DeepSeek Flash。原帖没有提供测试集、定价口径或评测数据,应作为个人选型线索而非排名结论。
Reddy 认为 Fable 5.1 因价格昂贵而被低估,在复杂代码库、困难 bug 修复和功能实现中明显优于 Opus 5.5,且较少需要反复调整 prompt。这是她的使用评价,原帖没有给出可复现案例或统一基准。
太空 TPU 与真实神经元计算指向不同的探索方向,两者都应按实验信号而非成熟产业能力看待。
Pichai 介绍 Project Suncatcher:与 Planet 合作制造的原型卫星将搭乘 SpaceX Transporter-18 任务,测试 TPU 能否在太空环境中存活并运行。这是原型验证计划,不能据此认定太空计算设施已经可用。
Jeff Dean 关注 Alex Ksendzovsky 及 BioComputingCo 团队利用真实大鼠神经元开展计算的工作,认为其中有值得学习的发现。帖文未展开实验方法、性能指标或应用成熟度。
关于失控、意识和现实伤害的讨论,需要区分科学可能性、当前证据与部署者责任。
Gebru 用“没锁好门却怪灰熊逃出”的比喻批评 rogue models 叙事:把系统描述成自行失控的主体,可能让公众忽略开发者和部署者的责任。这是她对责任归属的观点,原帖不足以独立核实任何具体安全事件。
Chollet 认为,既然物质曾在演化中产生感受能力,就不应从科学上排除它再次出现的可能;但他不认为当前 AI 已有这种能力,因为它们缺少他所预期的有感知 Agent 特征。他明确区分了未来可能性与对现有系统的判断。
Gebru 介绍一场汇集难民倡导者以及国际法、心理学和被迫迁移研究者的讨论,关注边境制度的人道后果,以及监控、数据和 AI 在移民管控中的使用。这把技术治理议题落到了具体受影响的人群。
创业选题和 AI 招聘的共同判断标准,是当事人是否理解客户、处理过失败,而非只会描述解决方案。
Kruger 回顾自己 24 岁任殡葬创业公司 CEO、融资 200 万美元后失败的经历:当时没有失去亲近之人的体验,并不理解客户。相比之下,后来做国际人才招聘时,他已经多次亲自遇到相关问题,因此主张 Founder-market fit 应先于 Product-market fit。
招聘 AI 实施人才时,Kruger 建议追问五件事:做过什么、解决了什么业务问题、哪里出错、为什么出错、如何修好。他强调应选择真正处理过落地复杂性的人,而不是只听候选人讲工具或愿景。