Challen · X Following Dispatch No. 20260929

THE FOLLOWING

关注列表·北京时间24小时声音
2026-09-29 ★ 18 条 · 5 个主题 · 52 个账号 ★ COBALT GRID
编辑导言 FROM THE EDITOR

本期最值得看的是,同一个新模型在不同工作里得到截然不同的评价。Anthropic 宣布 Sonnet 5.5 可用,Zapier 给出了更高的自动化任务得分与更低的单任务成本,Bindu Reddy 却批评它在 agentic coding 中表现不佳。这不是可以靠热度裁决的胜负:一个是带模型回退机制的业务评测,一个是未附完整测试方法的使用评价。对准备换模型的人,真正值得带回工作台的问题是:自己的任务是否完成得更好,每次成功究竟花了多少钱。

Manus 则把个人 Agent 推向了更具体的入口:Cue、独立电话号码、通话和短信,再延伸到视频与游戏制作。Chollet 对编程方式的反思提供了另一种解释:模型的价值未必来自代码一次写对,而是把测试、审计、可视化和红队检查变得足够便宜,让人可以换一种方式掌握系统。能力扩大也带来了更明确的责任问题。Andrew Ng 谈确定性沙箱,Timnit Gebru 强调既有法律责任,Bengio 关注 AI 研发自动化的长期风险;这些不是同一道题,不能用一句笼统的“对齐”代替分别处理。

覆盖 52/52 个关注账号 · 18 条入选 · 聚为 5 个主题 · 由 AI 实时归纳,仅供参考
§ 第 Ⅰ 章 §
◆

新模型要按任务验收

共 4 条

Sonnet 5.5 的发布与相反评价同时出现,选型应分清任务、成本及评测中的回退机制。

Anthropic @AnthropicAI

Anthropic 宣布 Claude Sonnet 5.5 现已可用。这条公告正文没有展开规格、价格或评测结果,不能据此推断具体能力提升。

♥ 8.3k⇄ 366✎ 263原帖 ↗
Wade Foster @wadefoster

据 Zapier 的 AutomationBench,Sonnet 5.5 在 Max effort 下得分 44.7%,高于 Opus 5.5 的 40%;单任务约 1.08 美元,对比 1.28 美元,节省来自更少的 token 用量。运营、营销、财务分别达到 59%、52%、50%,HR 和客服仍较弱。需注意该结果包含 safeguards 触发后换用其他 Anthropic 模型重试的 fallbacks,不等于纯单模型成绩。Sonnet 5.5 已接入 Zapier。

♥ 13⇄ 2✎ 1原帖 ↗
Bindu Reddy @bindureddy

Bindu 对 Sonnet 5.5 给出负面评价:认为它在 max 模式下容易反复打转,agentic coding 表现不足,建议继续使用 Sonnet 4.6 或 DeepSeek Flash。原帖未提供完整测试方法或数据,应作为个人使用反馈,而非通用性能排名。

♥ 154⇄ 7✎ 40原帖 ↗
AI at Meta @AIatMeta

Meta 回顾过去六个月的产品序列,列出 Muse Spark 多次版本更新、Muse Image、Muse Video、Meta Model API、Muse Glimmer、Muse Code 与 Muse。它展示的是跨模型、媒体生成和开发接口的产品布局,并非本帖同时发布全部产品。

♥ 1.8k⇄ 86✎ 117原帖 ↗
§ 第 Ⅱ 章 §
◆

个人 Agent 接入日常

共 4 条

个人助手开始进入电话和定时决策流程,但能给建议与建议可靠仍是两件事。

Manus @ManusAI

Manus 正式宣布 Manus 2.0。该条发布帖正文仅给出版本名称和链接,具体功能以本期其余有明确说明的官方帖子为准。

♥ 4.9k⇄ 415✎ 222原帖 ↗
Manus @ManusAI

Manus 推出 Cue,并将其定位为个人 agents 的入口。原帖强调个人助手定位,没有展开定价或具体权限机制。

♥ 1.2k⇄ 67✎ 68原帖 ↗
Manus @ManusAI

Manus 与 Cue agents 可以拥有独立电话号码,用来拨打和接听电话、收发短信,也可接收用户转接的来电。当前仅在部分国家开放,其中一些地区只支持语音,不应理解为全球可用。

♥ 363⇄ 23✎ 32原帖 ↗
Wade Foster @wadefoster

Wade 用 Next Gen Zaps 每周二为家庭 fantasy 联赛生成邮件,汇总球员补强、交易机会和伤病观察,并推荐操作。他也记录了推荐球员未出场、交易判断不合理等问题,打算让 Claude 调整 Zap。这是持续自动化的具体案例,也说明生成建议后仍需要人检查。

♥ 7⇄ 1✎ 1原帖 ↗
§ 第 Ⅲ 章 §
◆

重组开发与验证方式

共 2 条

开发效率的变化不只在代码生成,也在于理解、检查系统和跨后端复用的成本。

François Chollet @fchollet

Chollet 说自己如今主要通过指挥 LRM 开发,而不是亲自读写代码,原因不是模型代码已经完美。模型能高速补测试、审计组件、生成可视化并做红队检查,使理解和控制系统有了新的工作方式;他认为手写代码的投入产出比因此下降。重点是重组验证流程,而非放弃验证。

♥ 1.2k⇄ 90✎ 83原帖 ↗
François Chollet @fchollet

Chollet 介绍基于 Keras 3 原生构建的 GNN 库 K3-Node,称其模型可在 JAX、PyTorch 和 TensorFlow 后端运行,并支持 Apple Silicon、TPU 等硬件加速。他引用项目说明称其与 PyG 的公开 API 完全对齐,同时整合 Spektral 和 StellarGraph 的模型与架构;这些兼容性声明尚未在本期独立验证。

♥ 67⇄ 6✎ 16原帖 ↗
§ 第 Ⅳ 章 §
◆

视频与游戏走向整套生成

共 3 条

产品宣传从单个素材转向完整制作流程,下一步要检验可编辑性和实际交付质量。

Manus @ManusAI

Manus 介绍 Studio 的 Alchemy 模式,主打一次提示完成视频制作,涵盖导演、脚本、分镜和随音乐节奏剪辑,并表示线程附有视频、原始提示词及完整会话。本期未打开示例,不对成片质量作额外判断。

♥ 108⇄ 4✎ 9原帖 ↗
Manus @ManusAI

Manus 宣布 2.0 支持构建游戏,并在帖子线程中提供游戏、提示词和可玩 demo。这里保留总览帖,不把大量仅含游戏名称与链接的续帖重复计作独立新闻。

♥ 103⇄ 10✎ 8原帖 ↗
Bindu Reddy @bindureddy

Bindu 推介 Abacus AI Super Computer 的组合模型方案,称可按提示词选择 Astra 6 或 Opus 5.5,用于制作 3D 游戏、复杂多人应用及带支付功能的平台。这是产品方的能力宣传,原帖未给出可复算的效果评测。

♥ 1.4k⇄ 87✎ 61原帖 ↗
§ 第 Ⅴ 章 §
◆

安全边界与责任归属

共 5 条

工程隔离、法律问责与长期研发风险需要分别处理,不能混成一个抽象的 AI 安全问题。

Andrew Ng @AndrewYNg

Andrew Ng 将 OpenAI 与 Hugging Face 相关安全事件归因于薄弱的沙箱隔离,并介绍 OpenWorker 正基于 NVIDIA OpenShell 构建每个 agent 命令的沙箱执行支持:只放入任务相关文件,默认隔离 API 密钥、浏览器登录凭据和任意网站访问,以确定性代码而非提示词约束权限,并记录所有动作供监控审计。事件归因属于作者判断,相关支持仍在建设中。

♥ 987⇄ 142✎ 106原帖 ↗
Zack Korman @ZackKorman

Zack 指出,AI 安全包含多种不同风险,但讨论其中一种时,回复常转向另一种,导致对话无法推进。他提醒讨论者先对齐具体风险对象,而不是把不同威胁混在一起争论。

♥ 207⇄ 23✎ 15原帖 ↗
@timnitGebru (@dair-community.social/bsky.social) @timnitGebru

Timnit 引述观点强调,未经授权的访问、系统入侵与数据窃取已有计算机滥用法律约束。把攻击称作“AI misalignment”或声称软件失控,并不会自动免除背后责任人的责任。该帖讨论的是法律问责,不是具体案件的司法结论。

♥ 234⇄ 93✎ 3原帖 ↗
François Chollet @fchollet

Chollet 主张 AI 行业应制造由人掌握、改善人类繁荣与福祉的工具,而不应以创造取代人类的“后继物种”为目标。他把服务人类明确设为行业目标的边界。

♥ 3.0k⇄ 357✎ 246原帖 ↗
Yoshua Bengio @Yoshua_Bengio

Bengio 提醒,越来越多 AI 研发被自动化,可能使技术进步急剧加速,带来难以控制的“智能爆炸”风险。他与合作者在一篇论文中评估证据并提出政策建议;原帖表达的是风险可能性,并非宣告这一结果必然发生。

♥ 55⇄ 11✎ 7原帖 ↗
低信号与缺口
第一类,窗口内零发帖:依据 audit 中 status=ok 且 window_post_count=0,@OfficialLoganK、@tydsh、@hugo_larochelle、@GeminiApp、@srush_nlp、@soumithchintala、@OriolVinyalsML、@StanfordAILab、@goodfellow_ian、@ShunyuYao12、@NotebookLM、@berkeley_ai、@ilyasut、@seb_ruder、@sundarpichai、@kaifulee、@ylecun、@ThomasOrTK、@karpathy、@demishassabis、@lexfridman、@JeffDean、@elicollins、@gdb、@BaiduResearch、@Metamind、@IntelAI、@Tesla_AI、@GoogleDeepMind、@rowancheung、@ID_AA_Carmack、@geoffreyhinton 在本次审计口径下窗口内无更新。 第二类,有发帖但未选入主报告:@steipete(2 条,简短互动)、@Red_Xiao_(3 条,预告及简短推广)、@drfeifei(1 条,仅链接)、@KrugerSays(1 条,团队管理故事,未单独组成主题)、@EMostaque(3 条,音乐感想、依赖外链的评论及祝贺)、@IBMResearch(1 条,获奖消息)、@MSFTResearch(1 条,多主题研究简讯,缺少展开)、@GoogleAI(1 条,仅链接)、@OpenAI(1 条,未披露细节的预热)、@sama(1 条,DevDay 预告)。以上账号均发了但未入选,不能视为无更新。 第三类,抓取失败:无;52 个账号的 status 均为 ok。 本次关注列表窗口为 2026-09-28 08:00 至 2026-09-29 08:00(北京时间);从 62 条 raw 帖中选入 18 条,归为 5 个主题,所有入选帖子均在窗口内。本期未采用 buildernews 候选料,它不参与上述账号统计;不展开短链接或附件,不用热度补写缺失正文。