这一天的可核验信号集中在三个方向:AI 评测开始从研究工具变成投资和产品判断的基础设施,AI coding 正在向电脑操作、邮件处理和工程发布链路扩展,研究机构也在用转推把前沿 benchmark 和视觉推理工作放到关注列表里。
样本并不完整。部分账号在早期抓取中返回过结果,但没有留下可复核原始响应;我没有把这些记忆内容写进主报告。最终只使用当前可读取的 AgentKey 原始响应和本轮可见返回体,低信号与缺口在审计文件中逐项说明。
AI benchmark 和 evals 不再只是研究工具,开始被视为判断模型能力外溢和创业机会的投资基础设施。
Logan Kilpatrick 认为,围绕深度模型 benchmark 和 evals 做短中长期投资判断,已经足以支撑一家顶级 VC。核心是发现 capability overhang 和模型短板轨迹。
他进一步说,每家风投都应该有 evals 与 benchmark 团队,持续把模型拉出来实测,并自行构建新的评测体系。
Logan 判断顶级投资机构全面采用这种模型评测驱动投资方法只是时间问题。
AI coding 的讨论从写代码扩展到 PR、测试、发布、电脑操作和邮件工作流,重点变成工程系统如何被 AI 接管。
Bindu Reddy 说团队几乎全天与 AI 交互,代码、PR review、测试和生产发布都高度依赖 AI。
Greg Brockman 直接评价,用 Codex 操作电脑变得更有趣,说明 Codex 的叙事已经从编码工具转向计算机工作入口。
Zack Korman 讽刺企业不知道开发者拿 AI 干什么,真实答案可能是开发者在做个人 side project,点出了企业 AI 支出治理的盲区。
ChatGPT 邮件集成、Microsoft AI assistant 讨论和产品留存争议显示,AI 正在从独立聊天框迁入办公流。
Stanford 与 Berkeley 的窗口内更新主要是转推研究成果,关注代码生成 benchmark、科学生成模型和 CVPR 视觉推理。
Stanford AI Lab 转推 ProgramBench,强调 whole-repository generation benchmark 让 agent 自主选择需要修改的文件。
Stanford AI Lab 转推科学生成模型方向,用 unpaired data 到 data 的任务替代传统噪声到数据生成。
Berkeley AI Research 转推 Video-GMAE,关注无轨迹标签视频中学习 correspondence 的问题。
Berkeley AI Research 转推 CVPR 工作,强调在视觉 latent bottleneck 中进行推理可提升模型表现。