这一期值得展开的,不是模型又多了多少能力,而是这些能力怎样进入专业工作。OpenAI 的法律产品把检索、行业插件和律师可复核的流程放到一起;生命科学这边,Anthropic 谈推理加速与实验验证,DeepMind 给出基因变异研究案例。它们指向同一个问题:模型输出之后,谁来检查,怎样验证,能否真正降低工作成本?这些仍是发帖方披露的产品与研究进展,不等于已经获得独立效果验证。
落地的另一端是组织与工程。Bindu Reddy 提出的并行决策思路,试图减少 Agent 串行等待;李开复提醒,前沿模型风险与企业采用太慢可以同时成立。对管理者而言,执行加速并不会自动带来正确方向。与其只争论 AI 应该快还是慢,本期更值得跟进的是可检查的行业流程、明确的决策责任,以及 Anthropic 提出的研发参与度、Agent 监督和算力分配三类披露指标。
法律产品的重点从通用问答转向可溯源检索、行业工具连接和律师能够复核的工作流程。
OpenAI 发布 Astra for Law,由 GPT-6 Astra 驱动,面向律师和法律科技公司提供专用工具、设置与上下文,定位是支持专业判断,而非替代律师责任。
Astra for Law 配备法律分析与写作指令,以及新的 Legal Search Index。OpenAI 称索引覆盖超过 2.3 亿个 URL,检索美国判例、法律、法规、法院规则和行政裁决,并持续新增来源,让律师自行检查依据与相关段落。
OpenAI 披露与律所共建的三类流程:Sullivan & Cromwell 的协议分析、Ropes & Gray 的并购尽调,以及 Cooley 面向 IPO 准备的 GO Public。律师可审查、质疑和改进这些流程;符合条件的律所还可通过 Trusted Access 获得扩展的隐私与治理控制。
ChatGPT 法律工作新增 26 个合作伙伴插件和 47 个社区插件。Thomson Reuters、Harvey、Legora、iManage 等伙伴连接专业工具与知识,律师及法律工程师制作的社区插件则供律所适配和扩展。
从模型访问、推理成本到实验室验证,生物研究的进展开始呈现更具体的使用条件与验证路径。
Anthropic 开放 Life Sciences Verification Program 申请,以 beta 形式面向实验室、初创公司和药企等团队。经该计划,生命科学专业人员可在新安全措施下使用包括 Mythos 在内的模型;个人 Pro、Max 计划的覆盖仍属后续扩展方向。
Anthropic 称 Claude 优化了 30 多个开源生物模型的推理,平均提速 4 倍,部分优化来自为 GPU 编写定制软件。相关模型用于分子结构、类药分子设计和遗传突变效应预测,优化代码将全部开源。
Anthropic 与 Adaptyv Bio 合作举办蛋白质设计竞赛,计划实验验证超过 5,000 个设计。Anthropic 提供最高 100 万美元 Claude 额度并参与实验经费支持,Modal 提供最高 25 万美元算力,Twist Bioscience 提供 DNA。验证是计划中的环节,并非已经完成的成果。
DeepMind 披露,研究者与埃克塞特大学合作,用 AlphaGenome Atlas 分析超过 54,000 名 UK Biobank 参与者的数据,罕见遗传信号检出提升超过 22%,并发现影响代谢健康相关蛋白 PLA2G7 丰度的新 DNA 变异。
据 DeepMind 介绍,Broad Institute 研究人员用 AlphaGenome Atlas 从大量候选突变中定位到 DNM1 基因的一处关键突变,并在实验室确认验证,服务于不明原因罕见病的病因研究。
DeepMind 称,与 Stowers 研究所合作利用 Atlas 绘制了超过 2,500 种调控模式,识别在数百种细胞类型中调节基因活性的 DNA 序列,帮助解释基因表达的开关与强弱控制。
并行决策、版本交付和业务系统改造之外,企业仍需解决采用速度与管理判断的问题。
Bindu Reddy 介绍 Jev:不生成文本,而是通过一次前向计算返回各选项的概率。她认为这能减少 Agent 在选工具、选分支、重试等环节的串行等待,让规划、验证与安全检查并行开展,并称正在将其集成到 Abacus AI Agent;帖文未给出实测性能数据。
Peter Steinberger 在回复中称,gpt live 1 已在 main 分支上运行良好,计划本周发布,并邀请用户在 Web UI 中开启后反馈。这里区分了主分支可试用与正式版本尚待发布两个状态。
François Chollet 分享 Keras 3 帮助 Expedia 更新排序技术栈的案例。原帖只给出案例主题和链接,未披露迁移细节、性能指标或业务收益,不宜据此推断具体提升。
李开复认为,对前沿实验室最强、尚未发布模型的担忧有现实依据,但企业 AI 的实际采用速度仍然太慢。风险讨论与推动企业落地是需要同时处理的两件事。
Alex Kruger 以执行速度提高 5 倍作设想,强调管理者的价值将更集中在确定重点、设定标准、给出困难反馈、排序和判断,而不是确保每个人看起来都很忙。这里的倍数是论述前提,并非实测结论。
把可靠性研究与研发过程披露并列观察,比笼统争论模型是否危险更接近可执行的治理问题。
Anthropic 提出三项追踪 AI 发展的度量:AI 参与了多少 AI 研发、Agent 受到怎样的监督,以及算力如何分配。公司发布内部快照,并主张其他前沿开发者也披露同类指标、接受第三方验证,以缩小实验室与公众的信息差;原帖没有列出具体数值。
Yoshua Bengio 在 ALL IN 演讲中介绍面向更安全 AI 的诚实性与可靠性研究及近期融资,强调前沿能力增强时,社会治理与稳健的技术防护都不可缺少。LawZero 正围绕使 AI 持续符合人类利益开展研究。