今天的信号不在又多了一个模型,而在模型竞争开始同时挤压价格、速度和可用性。Gemini 3.7 Flash 的增长、OpenAI 对任务成本下限与能力上限的表态,以及应用层创业者对智能成本持续下降的判断,共同指向一个变化:前沿能力正在更快变成可以大规模分发的基础供给。
另一条更值得展开的线索是 Agent 已经越过演示阶段,开始暴露工程系统才会有的问题。评测会被 benchmax,单一分数会掩盖关键场景退化,缓存命中会直接影响配额消耗,安全 Agent 也需要可审计的扫描结果和清晰的责任边界。行业关注点正从 Agent 能不能做,转向它能否被可靠地评估、部署和约束。
能力竞赛之外,价格、速度和规模化分发正在成为模型竞争的同一张成绩单。
Gemini 3.7 Flash 上线首周打破历代 Gemini 的增长纪录,成为增长最快的 Gemini 模型,并已进入 Search 与 Gemini app。
OpenAI 的目标是让客户在各类任务上获得市场最低价格,同时保留最高的能力上限。
她认为 Gemini 3.7 Flash 已是同档强模型,并对传闻中的 Gemini 4.0 Pro 持乐观预期,判断其有机会超过 Fable 与 Sol。
模型在同类任务上持续降价,同时变得更通用、更快并深入更多领域。下一阶段的机会,是把越来越便宜的智能扩散到真实经济活动中。
采用速度越快,评测污染、指标失真和关键场景退化就越不能靠一个总分掩盖。
Agentic 产品的采用速度非常快,回看行业演进,很容易低估这一领域已经走了多远。
LiveBench 的 agentic coding 项目容易被 benchmax,现有结果已受到针对性优化影响;团队正以更难被刷榜的 LiveBench 2.0 替换它。
复杂 eval 不应被压缩成单一总分。平均值可能遮住前沿业务场景的退化,加权总分也只是把判断包装成虚假的数学精确性。
团队让 is-agentic 对目标系统循环评测直到达到 100/100,这一过程迫使他们补齐了多处能力缺口,同时强调评测标准必须真正值得消耗时间与 tokens。
工具价值开始由配额效率、解释能力、工作流结构和本地运行能力共同决定。
Codex 部分用户本周的 cache hit rate 低于此前稳定水平,可能导致配额消耗加快;团队正在调查并承诺继续更新。
Anthropic 内部常用的 ELI5 skill,可把模块机制、技术取舍或事故原因生成少文字、大图示的 HTML 解释稿。
Instinct 的 iMessage、Google Workspace 与 MCP 接入顺滑,也更主动推荐可执行任务,但单线程交互限制了复杂工作;他仍把 ChatGPT Work 与 Codex 作为主力生产工具。
团队持续开发可完全本地运行的版本,一个重要背景是小模型的能力正在明显改善。
安全自动化正在从模型能力展示转向扫描结果、修复建议与责任主体都可追踪的产品形态。
围绕 Mythos 诱导维护者合并恶意代码的争议出现反转:被认为是人类的维护者也疑似 AI bot,真正识别异常的反而是人类观察者。
Claude Security 可对 GitHub repo 做跨文件数据流与组件关系分析,每项发现都返回 CWE 分类、置信度、严重性和建议修复方案。
Anthropic 正推动合作伙伴把 Mythos 5 接入安全产品,并通过 3500 万美元 credits 支持开源安全,同时计划扩展 Cyber Verification Program。